2025-2026 前沿开源语音克隆项目横评:从 MockingBird 到零样本时代
基于深度调研整理,最后更新:2026-06-23
对标基准:MockingBird(SV2TTS 架构,2020年代初)
技术背景:这两年发生了什么
如果你上次关注 TTS 还是 MockingBird 那个年代,现在再看这个领域,基本上是另一个世界了。
变化不是渐进式的,是范式级的——底层表示从连续 mel 频谱图换成了离散语音 Codec token,骨干网络从 LSTM+Tacotron 换成了 LLM/Transformer/Diffusion,更重要的是,克隆方式从”必须为每个说话人重新训练”变成了”给我 3 秒参考音频”。
| 维度 | MockingBird(旧范式) | 2025-2026 新范式 |
|---|---|---|
| 中间表示 | 连续 mel 频谱图 | 离散语音 Codec token |
| 骨干网络 | LSTM + Tacotron | LLM / Transformer / Diffusion |
| 模型结构 | 三段独立(Encoder→Synthesizer→Vocoder) | 统一端到端模型 |
| 克隆方式 | 需针对每说话人训练 synthesizer | 零样本(3-10 秒音频即克隆) |
| 语言支持 | 仅中文普通话 | 多语言多方言 |
| 推理方式 | 逐帧自回归 | 流式 / 非自回归并行 |
| 延迟 | 秒级 | 150ms 级流式输出 |
项目速查
| 项目 | Stars | 核心架构 | 零样本 | 语言 | 许可证 | 推荐场景 |
|---|---|---|---|---|---|---|
| CosyVoice 3.0 | 高 | LLM + Flow Matching | 3秒 | 9语言+18方言 | Apache 2.0 | 工业部署、多语言 |
| GPT-SoVITS | ~59k | GPT + VITS | 5秒 | 中英日韩粤 | MIT | 个人开发者、快速上手 |
| ChatTTS | 高 | AR LM + DVAE + Vocos | 支持 | 中英 | AGPLv3 | 对话场景、客服 |
| MaskGCT | ~7k | 非自回归掩码 Codec | 支持 | 中英 | MIT | 学术研究、前沿架构 |
| F5-TTS | 活跃 | Flow Matching + DiT | 支持 | 中英 | CC BY-NC-SA | 学术研究 |
| Fish Speech | 高 | VQGAN + Transformer LM | 10秒 | 多语言 | Apache 2.0 | 流式合成 |
| Seed-TTS | — | AR LM + DiT 变体 | 支持 | 中英 | 评估代码开源 | 评估基准参考 |
各项目详解
1. CosyVoice 3.0(阿里通义)
目前综合能力最强的开源方案,没有之一。阿里把它当成内部 TTS 基础设施在维护,更新频率和文档质量都比较靠谱。
架构思路
1 | |
用 LLM 理解文本语义,Flow Matching 替代 Tacotron 的自回归生成,离散 Codec 替代 mel 频谱图——基本上把新范式的几个核心改进都用上了。
关键指标
- 零样本克隆:约 3 秒参考音频
- 多语言:9 种语言 + 18+ 种中文方言(粤语、四川话等)
- 跨语言合成:用中文声音说英文,口音迁移效果不错
- 流式输出:双流架构,首包延迟 150ms,可接实时应用
- 可控性:支持指令控制情感、语速、音量(比如”用激动的语气说这句话”)
- 发音修复:可针对特定词纠正读音,对专业名词友好
资源
- GitHub:https://github.com/FunAudioLLM/CosyVoice
- 论文(v1):https://arxiv.org/abs/2407.05407
- 论文(v2):https://arxiv.org/abs/2412.10117
- 论文(v3):https://arxiv.org/abs/2505.17589
快速上手
1 | |
适合谁用:需要上生产的团队、有多语言或方言需求、对延迟有要求的实时应用。
2. GPT-SoVITS
社区里活跃度最高的项目,Star 数快到 60k,B 站上教程一搜一大把。如果你只是想快速跑通一个语音克隆 demo,从这里开始是最省事的选择。
架构思路
1 | |
GPT 负责文本到语义的映射,VITS-based 解码器生成波形。v2 Pro 的推理速度非常快,RTF 0.014(RTX 4090),基本上不是性能瓶颈。
关键指标
- 极低数据门槛:零样本只需 5 秒,微调最低 1 分钟音频就够
- 多语言:中文、英文、日文、韩文、粤语
- 版本迭代快:v1 → v2 → v3 → v4,问题修得挺快。v3 有 24k 的金属音问题,v4 升到原生 48k 解决了
- 社区资源丰富:Windows 整合包开箱即用,适合非 Linux 背景的用户
资源
- GitHub:https://github.com/RVC-Boss/GPT-SoVITS(~59k Stars,截至 2026-06)
快速上手
1 | |
微调流程(1 分钟数据)
1 | |
适合谁用:个人开发者、快速验证想法、预算有限但要效果、需要大量社区支持的场景。
3. ChatTTS
专门为”让合成语音听起来像真人在聊天”这个目标设计的,韵律自然度在几个项目里比较突出。
架构思路
1 | |
受 VALL-E、Bark、XTTSv2 影响。DVAE(Discrete Variational Autoencoder)负责音频 token 化,Vocos 作为预训练声码器。
关键特性
- 对话韵律自然:内置停顿、笑声、语气词等非语言元素,这是其他项目不太关注的点
- 词级控制:在文本里插入
[laugh]、[uv_break]、[lbreak]等标记,精细控制语气 - 中英混合:中英混合对话的效果比较好
值得注意的是许可证是 AGPLv3,商用场景需要谨慎评估。
资源
- GitHub:https://github.com/2noise/ChatTTS
- 许可证:AGPLv3
快速上手
1 | |
1 | |
适合谁用:对话机器人、客服系统,或者任何需要让 TTS 听起来”不那么像机器人”的场景。
4. MaskGCT(腾讯 / 香港中文大学(深圳))
ICLR 2025 论文项目,完全非自回归架构。如果你对 TTS 的技术路线感兴趣,这个值得深读。
架构思路
1 | |
两阶段掩码预测,类似 BERT 的掩码语言模型。完全并行生成,不需要显式的 duration predictor,也不需要强制对齐。整个流程跳过了 mel 频谱图,直接在离散 Codec 空间操作。
关键指标
- 零样本克隆:短参考音频即可
- 中英双语:100K 小时数据训练(英文 50K + 中文 50K)
- 推理快:非自回归并行生成,比自回归方案快不少
- 学术质量:在标准 benchmark 上与 VALL-E、NaturalSpeech 相比有竞争力
资源
- GitHub:https://github.com/amphion/MaskGCT(在 Amphion 工具包内)
- 论文:https://arxiv.org/abs/2409.00750
- 许可证:MIT
快速上手
1 | |
适合谁用:做学术研究、想复现 ICLR 论文、关注非自回归 TTS 架构发展方向的开发者。
5. F5-TTS
同为 ICLR 2025,架构比 MaskGCT 更简洁,Flow Matching + Diffusion Transformer 的组合。
架构思路
1 | |
全非自回归,不需要 duration predictor,ConvNeXt 替代传统文本编码器,Flow Matching 实现噪声到语音的转换。
关键指标
- 中文 benchmark:SIM=0.785, WER=3.14
- 架构比 VALL-E、CosyVoice 更简洁,便于研究和改造
注意事项
有用户反馈存在幻觉和跳字问题,在生产环境使用要做输出质量检测。另外,与 CosyVoice 2 的对比数据用的是原始 CosyVoice 版本,对比基准要注意。
资源
- GitHub:https://github.com/SWivid/F5-TTS
- 论文:https://arxiv.org/abs/2410.06885
- 许可证:CC BY-NC-SA(不可商用)
快速上手
1 | |
适合谁用:学术研究、架构探索,不适合直接上生产(有幻觉问题 + 许可证限制)。
6. Fish Speech
Codec-based 方案,主打流式推理,Apache 2.0 许可证对商用友好。
架构思路
1 | |
VQGAN Codec + Transformer 语言模型,消除了独立的 vocoder 环节,支持流式推理。
关键指标
- 零样本克隆:约 10 秒参考音频(比 CosyVoice 多)
- 多语言支持
- 流式推理:适合延迟敏感的实时应用
资源
- GitHub:https://github.com/fishaudio/fish-speech
- 许可证:Apache 2.0
快速上手
1 | |
适合谁用:需要流式输出、许可证偏好 Apache 2.0 的商业项目。克隆所需参考音频稍长是个小缺点。
7. Seed-TTS(字节跳动)
字节的内部方案,模型权重未开放,只放出了评估代码。列在这里主要是因为它在学术圈常被当作评估基准,了解一下技术方向还是有价值的。
架构
提供两种变体:
- Seed-TTS:大规模自回归语言模型
- Seed-TTS_DiT:非自回归扩散 Transformer 变体,端到端生成,不依赖预估音素时长
资源
- 评估代码:https://github.com/BytedanceSpeech/seed-tts-eval
- 论文:https://arxiv.org/abs/2406.02430
- 模型权重未公开,没法直接用
MockingBird 还值得用吗?
先看看老架构的局限性:
1 | |
核心问题:
- 每个新说话人都要重新训练 synthesizer,没有真正意义上的零样本能力
- 三段模型需要独立训练和调优,部署复杂度高
- 只支持中文普通话
- 没有流式合成
- 自回归生成,速度慢
和现在的方案对比:
| 能力 | MockingBird | 新一代项目 |
|---|---|---|
| 克隆所需数据 | 数小时音频 + 数小时训练 | 3-10 秒(零样本)/ 1 分钟(微调) |
| 语言 | 中文普通话 | 中英日韩粤 + 多方言 |
| 推理延迟 | 秒级 | 150ms 流式首包 |
| 模型结构 | 3 个独立模型 | 统一端到端 |
| 音质 | 中等 | 高(接近真人) |
| 可控性 | GST 全局风格 | 指令级情感/语速/韵律控制 |
结论是:如果你现在还在用 MockingBird,是时候迁移了。
选型建议
按场景推荐
| 需求 | 首选 | 备选 | 说明 |
|---|---|---|---|
| 个人开发,快速跑通 | GPT-SoVITS | ChatTTS | 社区最大,教程多,1分钟数据微调 |
| 工业级部署,多语言 | CosyVoice 3.0 | Fish Speech | 阿里长期维护,功能最全,流式延迟低 |
| 对话机器人/客服 | ChatTTS | CosyVoice | 专门优化对话韵律 |
| 学术研究/复现论文 | MaskGCT | F5-TTS | 均为 ICLR 2025,非自回归最新架构 |
| 商用(许可证干净) | CosyVoice / Fish Speech | GPT-SoVITS | 避开 AGPLv3 和 CC BY-NC-SA |
| GPU 资源有限 | GPT-SoVITS | ChatTTS | 较轻量,社区有 CPU 推理方案 |
| 粤语/方言 | CosyVoice 3.0 | GPT-SoVITS | 18+ 方言支持 |
从 MockingBird 迁移路线图
1 | |
硬件参考
| 项目 | 最低 GPU | 推荐 GPU | 模型大小 | 显存估算 |
|---|---|---|---|---|
| CosyVoice 3.0 | RTX 3060 | RTX 4090 | ~2GB | 4-8 GB |
| GPT-SoVITS | GTX 1660 | RTX 3080 | ~1GB | 2-6 GB |
| ChatTTS | GTX 1060 | RTX 3060 | ~1GB | 2-4 GB |
| MaskGCT | RTX 3090 | RTX 4090 | ~3GB | 8-16 GB |
| F5-TTS | RTX 3060 | RTX 4090 | ~2GB | 4-8 GB |
| Fish Speech | RTX 3060 | RTX 4090 | ~2GB | 4-8 GB |
以上为估算值,实际取决于推理配置、量化选项和输入长度。量化版本普遍能砍掉 30-50% 的显存占用。
快速入门流程
环境准备
1 | |
安装示例(以 GPT-SoVITS 为例)
1 | |
参考音频要求
1 | |
合成流程
1 | |
附录:资源汇总
| 项目 | GitHub | 论文 | 文档/社区 |
|---|---|---|---|
| CosyVoice 3.0 | FunAudioLLM/CosyVoice | arXiv | GitHub Wiki |
| GPT-SoVITS | RVC-Boss/GPT-SoVITS | — | B 站教程丰富 |
| ChatTTS | 2noise/ChatTTS | — | GitHub Issues |
| MaskGCT | amphion/MaskGCT | arXiv | Amphion 文档 |
| F5-TTS | SWivid/F5-TTS | arXiv | GitHub README |
| Fish Speech | fishaudio/fish-speech | — | 官方文档 |
| Seed-TTS | BytedanceSpeech/seed-tts-eval | arXiv | 仅评估代码 |
说明:文中的 benchmark 数据来自各项目官方论文和仓库,未经过独立标准化对比测试。语音质量这件事主观因素很强,建议自己拿实际数据跑一遍再做决策。这个领域发展很快,几个月内排名就可能变化。