YP AI 全能创作台 购卡激活
本地运行 · 素材不出本机 · 解压即用

从一段文字到一部成片,
一个软件全流程做完

YP AI 全能创作台(YP AI Studio)—— 把语音克隆、字幕配音、有声书、视频翻译配音、人声伴奏分离、AI 图生视频、一键抠图、数字人、高清换脸、直播换脸、翻唱变声整合进同一个中文界面。一张照片 + 一段音频就能生成口型同步的数字人视频;一段文字 + 一张图就能生成带运镜的短视频;3 秒参考音频即可复刻音色;字幕文件一键转配音、一键烧录、一键翻译成外语重新配音。所有 AI 推理都在你本机完成,照片、视频、声音不上传服务器。免配置环境,解压即用,支持中文路径,兼容 NVIDIA 10/20/30/40/50 系列,也可纯 CPU 启动。

25+功能模块,一个界面做完
5 种语音克隆语种(中英日西阿)
8 维情感控制,还可直接用文字描述
100%本机推理,素材不出电脑
LIVE DEMO

2 分钟看完它能做什么

配音、字幕、视频翻译、数字人、换脸的实拍演示,点开就能看。

页面无法直接播放时,可点此下载演示视频查看。

FEATURES

核心功能:一个软件,一条生产线

从文案、配音、字幕,到视频配音、翻译配音、图生视频、抠图、数字人、换脸、翻唱,全部在同一个窗口里完成。

01
🗣️

语音克隆 · 音色复刻

给 3 秒以上干净人声就能复刻音色,官方 IndexTTS 2.5 模型,支持中文、英文、日文、西班牙文、阿拉伯文。

02
🎭

情感控制 · 不只是念稿

三种方式任选:跟随参考音频的情绪、八维情感滑块(喜悦·愤怒·悲伤·恐惧·厌恶·忧郁·惊喜·平静)、或者直接用文字描述,比如"悲伤哽咽地说话"。

03
📄

批量 TXT · 批量 ZIP

一行一段批量合成后自动合并,也可一次上传多个 TXT;大批量任务打包成 ZIP 下载,支持断点续传,中断了再点一次接着做。

04
🎬

SRT 字幕转语音

按字幕时间轴逐条配音,三种对齐策略:停顿对齐(不变调,推荐)、严格卡时长、按语速自由读;可自动过滤识别幻觉产生的假句子。

05
📚

有声书 · 多人对话

一个 TXT 一章,逐章合成并合并,可设置章节间停顿;多人对话按"角色:台词"格式,给每个角色指定不同音色。

06
🔍

语音转文字 · 字幕精修

本地 Whisper large-v3,快速/高精度/极致三档,直接导出 SRT。识别结果会做幻觉过滤与静音对齐,减少多词、漏词、时间轴偏移。

07
🎞️

视频配音 · 字幕烧录

视频去原声,按字幕时间轴换成新配音,可选择是否把字幕烧进画面;字体、字号、距底边、时间偏移都能调,字体已内置,换台电脑也不会糊。

08
🌐

视频自动翻译配音

一条龙:自动识别原视频语音 → 本地翻译 → 生成配音 → 输出配音视频 + 翻译字幕,不懂外语也能把中文片子发到海外平台。

09
🈯

文本翻译

内置 NLLB 本地翻译模型,多语言互译,不联网也能用,长文本直接粘贴翻译。

10
🎧

人声伴奏分离 · BGM 混音

htdemucs 标准模式 / htdemucs_ft 精细模式,一键拆出人声与伴奏两轨;内置 BGM 可试听,人声、伴奏音量与淡入淡出可调,BGM 不够长自动循环。

11
🧑

数字人 · 三种引擎

IMTalker 音频驱动(快,头部说话)、IMTalker 视频驱动(把视频里的表情动作搬到图片上)、InfiniteTalk 高清引擎(口型、头动、表情、身体姿态一起跟随,时长不限);另有一键"视频驱动换脸版",保留原视频的身体和背景,只把脸换成你的。

12
🎥

高清换脸 · 直播换脸

高清换脸:图片或整段视频换脸,保留原视频的一切,只换人脸,支持多张来源图、脸对脸映射、遮挡保护。直播换脸:摄像头实时换脸,镜头前就能直播,内置增强引擎,帧率与效果超过原版 Pro。

13
🎤

翻唱变声

Seed-VC 零样本歌声转换,保留原曲的旋律和节奏,只换成目标音色,可直接混入伴奏合成完整歌曲。

14
🔌

API 服务 · 文件夹监控

一键启动本地 API(带接口文档),其他软件能直接调用你的语音合成;文件夹监控盯住一个目录,新放入的文案或音频自动开始合成,挂机就能出货。

15
🗂️

音色库 · 多音字标注

音色可保存、改名、随时调用,长期攒下自己的音色库;多音字自动识别并可手动指定读音,专治"重、长、行、了、差、着"这类字读错,中文配音更靠谱。

16

AI 图生视频

一张图片 + 一句画面描述,就能生成一段带运镜的短视频。用的是内置的 Wan2.1 图生视频模型 + 4 步加速,全本机生成,不用再另外下模型。

17
✂️

一键抠图 · 换背景

人像、商品、宠物一键去背,输出带透明通道的 PNG;也能直接换成白底、蓝底、红底(证件照常用底色),支持边缘羽化,单张约 1 秒。

18
💡

图片反推提示词

传一张图,自动写成一段描述,还能提取图里的文字;顺手翻译成中文。拿去做画图、图生视频的提示词正好,单张约 1 秒。

MODULES

菜单里一共有这些

全部功能都在同一个界面,装一次、开一次就能用,不用来回切软件。

栏目能做什么适合谁
语音克隆参考音频克隆音色,五种语言,情感控制,多音字手动标注口播号、带货号、有声书
批量 TXT一行一段批量合成并自动合并,可上传多个 TXT 文件脚本批量出片
SRT 转语音按字幕时间轴逐条配音,可过滤识别幻觉影视解说、短剧配音
批量合成 ZIP大批量任务打包下载,支持断点续传几百上千条的批量活
语音转文字本地 Whisper large-v3,三档精度,导出 SRT扒字幕、做解说稿
有声书模式一章一个 TXT,逐章合成合并,可设章节停顿有声小说、长视频旁白
多人对话多角色各配一个音色,按"角色:台词"合成广播剧、对话类口播
音频后处理淡入淡出、响度归一化(LUFS),输出 WAV / MP3音频素材整理
人声伴奏分离标准 / 精细两档,拆出人声与伴奏两轨翻唱、二创、去伴奏
BGM 混音内置 BGM 试听,人声与伴奏音量、淡入淡出可调给配音加背景音乐
视频处理字幕烧录、视频配音(可带字幕)、音轨替换成片包装、换配音
文本翻译本地 NLLB 多语言互译文案出海、字幕翻译
视频自动翻译配音识别 + 翻译 + 配音,输出配音视频与翻译字幕搬运、出海、多语版本
AI 图生视频一张图 + 一句描述 → 3~5 秒短视频,内置 Wan2.1 加速版让照片动起来、短视频素材
一键抠图去背输出透明 PNG,或直接换白 / 蓝 / 红底证件照、电商图、素材处理
图片反推提示词图片自动写成描述,可提取图中文字并翻译成中文反推提示词、打标、OCR
ComfyUI 工作台内置完整 ComfyUI(2360+ 节点),软件里一键启动进阶玩法、自己加模型和节点
API 服务一键启停,本机或局域网调用,带接口文档接到自己的脚本/系统里
数字人音频驱动 / 视频驱动 / InfiniteTalk 高清引擎 / 视频驱动换脸版虚拟主播、口播号
高清换脸图片、视频换脸并导出成品,多来源图与遮挡保护剧情号、二创剪辑
直播换脸摄像头实时换脸,窗口内快捷键切换增强、遮挡、对比直播、连麦、真人出镜
翻唱变声保留旋律节奏换成你的音色,可混伴奏翻唱、AI 歌手
文件夹监控盯住一个目录,新放入的文案/音频自动合成挂机批量生产
音色管理 / 多音字标注保存、改名、删除音色;自动识别多音字并可手动指定读音长期维护自己的音色库
计算时间 / 模型 / 系统信息预估耗时、确认模型完整性、查看显卡与运行模式、一键释放显存排故障、安排任务

软件会随版本更新持续增加功能,具体栏目与参数以你拿到的版本为准。

WHY IT'S FAST

为什么它比"拼软件"省事

别人是七八个软件拼起来,这里是同一套环境、同一个界面。

01

极速引擎自动开启

显存 ≥10GB 且为 RTX 30/40/50 时自动启用极速引擎(FlashAttention + Triton),低端显卡自动走普通模式,不会因为开错模式跑不动。

02
🧩

一套环境,全部功能共用

语音、字幕、视频、数字人、换脸、翻唱都是同一个 Python 环境和同一批模型,装一次全部能用,不用装七八个软件、不用来回切显卡驱动。

03
🖥️

内置 ComfyUI,开箱可用

数字人高清引擎跑在整合包自带的 ComfyUI 上,用的时候自动启动、闲置 5 分钟自动关闭释放显存,不用你自己装节点、配环境。

04
🎯

换脸引擎做了加强

直播换脸用的是内置的深度换脸引擎,在本整合包里重新优化过:速度更快、画面更稳,帧率和效果都超过原版。

05
🔒

全本地推理

语音合成、识别、翻译、数字人、换脸全部在你电脑上跑,联网只用于授权校验,照片、视频、声音不会上传。

06
🇨🇳

中文路径 · 免配置 · 断点续传

解压到中文目录也能跑,界面全中文;首次生成加载模型约 20~40 秒,之后明显更快;大批量任务支持断点续传,中断了接着做。

DOWNLOAD

软件下载

解压后双击根目录的启动器即可运行,模型与环境全部内置,无需另外安装。

REQUIREMENTS

不同电脑的表现

整合包已按显卡类型分别适配,买之前先对一下自己的机器。

电脑 / 显卡推荐用法说明
NVIDIA RTX 30 / 40 / 50 系列全部功能全开,自动启用极速引擎数字人、换脸、语音都流畅
NVIDIA RTX 20 系列、3050 6G全部功能可用推荐起点,长时间批量也稳
GTX 10 / 16 系列老卡自动切换兼容模型,高清增强建议关能用,换脸可直播,帧率约十几帧
AMD / Intel 核显、纯 CPU低分辨率 + 关闭高清增强能跑,速度较慢,适合先体验

系统要求:Windows 10 / 11 64 位。整合包体积较大(含全部模型),建议预留足够硬盘空间;运行占用显存 2–4GB,数字人高清引擎更高。

PRICING

三种套餐,按需选择

激活卡首次使用时绑定单台电脑,可解绑换机。

月卡套餐

¥30 / 30 天
原价 ¥60,适合先短期体验
  • 30 天使用时长
  • 全部功能无限制使用
  • 含后续版本更新
去购卡
最多人选择

年卡套餐

¥88 / 365 天
一次购卡,一整年使用,性价比最高
  • 365 天使用时长
  • 全部功能无限制使用
  • 含后续版本更新
  • 平均每天不到三毛钱
去购卡 →

永久激活

¥288 / 永久
一次付费,长期使用
  • 永久使用授权
  • 全部功能无限制使用
  • 含后续版本更新
去购卡 →

购买入口:https://ai.yp89.cn/shop/ · 在购卡页左侧选择「YP AI 全能创作台」,再选套餐即可。

QUICK START

三步开始使用

解压并启动

下载后解压,中文路径也没问题;双击根目录的启动器,等浏览器自动打开界面。

选栏目、放素材

要配音就进「语音克隆」或「SRT 转语音」,要成片就进「视频处理」,要数字人就进「数字人」,要换脸就进「高清换脸 / 直播换脸」。每页顶部都有说明,第一次用照着点就能跑。

生成并导出

成品统一保存在程序目录的 outputs 文件夹,历史记录里也能直接回听回看,拿去做剪辑或直接发布。

FAQ

常见问题

这个整合包里到底有什么?

语音克隆、批量 TXT、SRT 转语音、批量合成 ZIP、语音转文字、有声书、多人对话、音频后处理、人声伴奏分离、BGM 混音、视频处理(字幕烧录/视频配音/音轨替换)、文本翻译、视频自动翻译配音、数字人、高清换脸、直播换脸、翻唱变声、文件夹监控、API 服务等 20 多个栏目,全部在一个界面里,功能会随版本继续增加。

数字人的音频驱动和视频驱动有什么区别?

音频驱动给的是"照片 + 音频",照片里的人按音频开口说话;视频驱动给的是"照片 + 视频",照片里的人照着视频里的动作和口型动起来;另外还有 InfiniteTalk 高清引擎,口型、头部动作、表情、身体姿态一起跟随,时长不限。三种都是照片里的人出镜,素材只是驱动来源。

视频翻译配音是怎么做的?

上传视频后,软件自动识别里面的说话内容、翻译成你指定的语言、再用选定的音色重新配音,最后输出配音好的视频和翻译字幕,全程本机完成。

人声伴奏分离能用来干什么?

可以把一首歌或一段带背景音乐的素材拆成人声和伴奏两条音轨,用于翻唱、二创、去伴奏。也可以先分离出干净人声,再拿去给数字人或语音克隆当参考音频——这一步很关键,带背景音乐会让口型乱动。

我的电脑能运行吗?

推荐 NVIDIA RTX 20 / 30 / 40 / 50 系列,3050 6G 起步体验更好。GTX 10 / 16 等老显卡会自动走兼容模型,能跑但帧率低一些;没有 NVIDIA 显卡的电脑可用 CPU 模式,速度较慢,适合先体验效果。

不会用、参数太多怎么办?

每个页面顶部都有说明,软件内还带完整「软件帮助」和「常见问题」,照着点就能跑。绝大多数功能用默认参数就是最佳效果。

照片和视频会上传到服务器吗?

不会。语音合成、识别、翻译、数字人、换脸全部在你本机完成,联网只用于授权校验。

API 服务是什么,有什么用?

在「API 服务」页一键启动后,会得到一个本机接口地址和接口文档,其他程序、脚本、网站可以直接调用你的语音合成能力,也可以选择允许局域网内的设备访问。适合接到自己的自动化流程里。

怎么购买和激活?

在购卡页左侧选择「YP AI 全能创作台」,选套餐、付款后会立刻拿到授权码,在软件里输入卡号激活即可。激活码首次使用时绑定这台电脑。

可以离线使用吗?

可以。授权校验完成后本机记住授权,之后到期前都能离线使用;断网不影响生成。

⚠️ 合规提示:请只使用你有权使用的人像、声音与视频素材。请勿用于冒充他人、诈骗或侵犯他人权益的用途,并遵守所在地法律及平台规范。克隆他人声音须获得本人授权。