2025-2026 前沿开源语音克隆项目横评:从 MockingBird 到零样本时代

基于深度调研整理,最后更新:2026-06-23
对标基准:MockingBird(SV2TTS 架构,2020年代初)


技术背景:这两年发生了什么

如果你上次关注 TTS 还是 MockingBird 那个年代,现在再看这个领域,基本上是另一个世界了。

变化不是渐进式的,是范式级的——底层表示从连续 mel 频谱图换成了离散语音 Codec token,骨干网络从 LSTM+Tacotron 换成了 LLM/Transformer/Diffusion,更重要的是,克隆方式从”必须为每个说话人重新训练”变成了”给我 3 秒参考音频”。

维度 MockingBird(旧范式) 2025-2026 新范式
中间表示 连续 mel 频谱图 离散语音 Codec token
骨干网络 LSTM + Tacotron LLM / Transformer / Diffusion
模型结构 三段独立(Encoder→Synthesizer→Vocoder) 统一端到端模型
克隆方式 需针对每说话人训练 synthesizer 零样本(3-10 秒音频即克隆)
语言支持 仅中文普通话 多语言多方言
推理方式 逐帧自回归 流式 / 非自回归并行
延迟 秒级 150ms 级流式输出

项目速查

项目 Stars 核心架构 零样本 语言 许可证 推荐场景
CosyVoice 3.0 LLM + Flow Matching 3秒 9语言+18方言 Apache 2.0 工业部署、多语言
GPT-SoVITS ~59k GPT + VITS 5秒 中英日韩粤 MIT 个人开发者、快速上手
ChatTTS AR LM + DVAE + Vocos 支持 中英 AGPLv3 对话场景、客服
MaskGCT ~7k 非自回归掩码 Codec 支持 中英 MIT 学术研究、前沿架构
F5-TTS 活跃 Flow Matching + DiT 支持 中英 CC BY-NC-SA 学术研究
Fish Speech VQGAN + Transformer LM 10秒 多语言 Apache 2.0 流式合成
Seed-TTS AR LM + DiT 变体 支持 中英 评估代码开源 评估基准参考

各项目详解

1. CosyVoice 3.0(阿里通义)

目前综合能力最强的开源方案,没有之一。阿里把它当成内部 TTS 基础设施在维护,更新频率和文档质量都比较靠谱。

架构思路

1
文本 → LLM(预测离散语音 token)→ Flow Matching 生成声学特征 → HiFi-GAN 解码 → 波形

用 LLM 理解文本语义,Flow Matching 替代 Tacotron 的自回归生成,离散 Codec 替代 mel 频谱图——基本上把新范式的几个核心改进都用上了。

关键指标

  • 零样本克隆:约 3 秒参考音频
  • 多语言:9 种语言 + 18+ 种中文方言(粤语、四川话等)
  • 跨语言合成:用中文声音说英文,口音迁移效果不错
  • 流式输出:双流架构,首包延迟 150ms,可接实时应用
  • 可控性:支持指令控制情感、语速、音量(比如”用激动的语气说这句话”)
  • 发音修复:可针对特定词纠正读音,对专业名词友好

资源

快速上手

1
2
3
4
5
6
7
8
9
10
11
12
git clone https://github.com/FunAudioLLM/CosyVoice.git
cd CosyVoice

conda create -n cosyvoice python=3.10
conda activate cosyvoice
pip install -r requirements.txt

# 下载预训练模型(也可以从 HuggingFace 拉)
python -c "from modelscope import snapshot_download; snapshot_download('iic/CosyVoice-300M', local_dir='pretrained_models/CosyVoice-300M')"

# 启动 Gradio Web UI
python webui.py

适合谁用:需要上生产的团队、有多语言或方言需求、对延迟有要求的实时应用。


2. GPT-SoVITS

社区里活跃度最高的项目,Star 数快到 60k,B 站上教程一搜一大把。如果你只是想快速跑通一个语音克隆 demo,从这里开始是最省事的选择。

架构思路

1
文本 → GPT(自回归预测语义 token)→ SoVITS(VITS 解码器)→ 波形

GPT 负责文本到语义的映射,VITS-based 解码器生成波形。v2 Pro 的推理速度非常快,RTF 0.014(RTX 4090),基本上不是性能瓶颈。

关键指标

  • 极低数据门槛:零样本只需 5 秒,微调最低 1 分钟音频就够
  • 多语言:中文、英文、日文、韩文、粤语
  • 版本迭代快:v1 → v2 → v3 → v4,问题修得挺快。v3 有 24k 的金属音问题,v4 升到原生 48k 解决了
  • 社区资源丰富:Windows 整合包开箱即用,适合非 Linux 背景的用户

资源

快速上手

1
2
3
4
5
6
7
8
9
# Windows 用户直接从 Releases 下整合包,解压即用

# 手动安装
git clone https://github.com/RVC-Boss/GPT-SoVITS.git
cd GPT-SoVITS
conda create -n gptsovits python=3.10
conda activate gptsovits
pip install -r requirements.txt
python webui.py

微调流程(1 分钟数据)

1
2
3
4
5
6
# 1. 把音频文件放到 dataset/ 目录
# 2. WebUI 里走以下步骤:
# - 音频标注(自动 ASR 转文字,支持手动校对)
# - 训练 SoVITS 模型(约 5-15 分钟)
# - 训练 GPT 模型(约 5-15 分钟)
# - 推理合成

适合谁用:个人开发者、快速验证想法、预算有限但要效果、需要大量社区支持的场景。


3. ChatTTS

专门为”让合成语音听起来像真人在聊天”这个目标设计的,韵律自然度在几个项目里比较突出。

架构思路

1
文本 → 自回归 Transformer LM → DVAE 解码 → Vocos 声码器 → 波形

受 VALL-E、Bark、XTTSv2 影响。DVAE(Discrete Variational Autoencoder)负责音频 token 化,Vocos 作为预训练声码器。

关键特性

  • 对话韵律自然:内置停顿、笑声、语气词等非语言元素,这是其他项目不太关注的点
  • 词级控制:在文本里插入 [laugh][uv_break][lbreak] 等标记,精细控制语气
  • 中英混合:中英混合对话的效果比较好

值得注意的是许可证是 AGPLv3,商用场景需要谨慎评估。

资源

快速上手

1
2
3
git clone https://github.com/2noise/ChatTTS.git
cd ChatTTS
pip install -r requirements.txt
1
2
3
4
5
6
7
8
9
import ChatTTS
import soundfile as sf

chat = ChatTTS.Chat()
chat.load_models(compile=False) # compile=True 可加速,但首次加载慢

texts = ["你好,欢迎使用 ChatTTS,这是一个对话场景的语音合成系统。"]
wavs = chat.infer(texts, use_decoder=True)
sf.write("output.wav", wavs[0][0], 24000)

适合谁用:对话机器人、客服系统,或者任何需要让 TTS 听起来”不那么像机器人”的场景。


4. MaskGCT(腾讯 / 香港中文大学(深圳))

ICLR 2025 论文项目,完全非自回归架构。如果你对 TTS 的技术路线感兴趣,这个值得深读。

架构思路

1
2
3
文本 → Text-to-Semantic 模型(掩码预测语义 token

Semantic-to-Acoustic 模型(掩码预测声学 Codec token)→ 波形

两阶段掩码预测,类似 BERT 的掩码语言模型。完全并行生成,不需要显式的 duration predictor,也不需要强制对齐。整个流程跳过了 mel 频谱图,直接在离散 Codec 空间操作。

关键指标

  • 零样本克隆:短参考音频即可
  • 中英双语:100K 小时数据训练(英文 50K + 中文 50K)
  • 推理快:非自回归并行生成,比自回归方案快不少
  • 学术质量:在标准 benchmark 上与 VALL-E、NaturalSpeech 相比有竞争力

资源

快速上手

1
2
3
4
5
6
7
8
git clone https://github.com/open-mmlab/Amphion.git
cd Amphion
conda create -n amphion python=3.10
conda activate amphion
pip install -r requirements.txt

# 推理(参考 examples/maskgct/ 目录)
python inference.py --model maskgct --input "你好世界" --reference ref.wav

适合谁用:做学术研究、想复现 ICLR 论文、关注非自回归 TTS 架构发展方向的开发者。


5. F5-TTS

同为 ICLR 2025,架构比 MaskGCT 更简洁,Flow Matching + Diffusion Transformer 的组合。

架构思路

1
文本 → ConvNeXt 文本编码器 → 上采样 → Diffusion Transformer(Flow Matching)→ 波形

全非自回归,不需要 duration predictor,ConvNeXt 替代传统文本编码器,Flow Matching 实现噪声到语音的转换。

关键指标

  • 中文 benchmark:SIM=0.785, WER=3.14
  • 架构比 VALL-E、CosyVoice 更简洁,便于研究和改造

注意事项

有用户反馈存在幻觉和跳字问题,在生产环境使用要做输出质量检测。另外,与 CosyVoice 2 的对比数据用的是原始 CosyVoice 版本,对比基准要注意。

资源

快速上手

1
2
3
4
5
6
7
8
9
10
11
12
git clone https://github.com/SWivid/F5-TTS.git
cd F5-TTS
pip install -e .

# 命令行推理
f5-tts_infer --model F5TTS_v1_Base \
--ref_audio reference.wav \
--ref_text "参考音频对应的文字" \
--gen_text "要合成的文字"

# Web UI
python app.py

适合谁用:学术研究、架构探索,不适合直接上生产(有幻觉问题 + 许可证限制)。


6. Fish Speech

Codec-based 方案,主打流式推理,Apache 2.0 许可证对商用友好。

架构思路

1
文本 → Decoder-only Transformer LM → VQGAN Codec 解码 → 波形

VQGAN Codec + Transformer 语言模型,消除了独立的 vocoder 环节,支持流式推理。

关键指标

  • 零样本克隆:约 10 秒参考音频(比 CosyVoice 多)
  • 多语言支持
  • 流式推理:适合延迟敏感的实时应用

资源

快速上手

1
2
3
4
5
6
7
8
9
git clone https://github.com/fishaudio/fish-speech.git
cd fish-speech
pip install -e .

# Web UI
python -m fish_speech.webui

# API 服务
python -m fish_speech.api_server

适合谁用:需要流式输出、许可证偏好 Apache 2.0 的商业项目。克隆所需参考音频稍长是个小缺点。


7. Seed-TTS(字节跳动)

字节的内部方案,模型权重未开放,只放出了评估代码。列在这里主要是因为它在学术圈常被当作评估基准,了解一下技术方向还是有价值的。

架构

提供两种变体:

  • Seed-TTS:大规模自回归语言模型
  • Seed-TTS_DiT:非自回归扩散 Transformer 变体,端到端生成,不依赖预估音素时长

资源


MockingBird 还值得用吗?

先看看老架构的局限性:

1
2
3
参考音频 → LSTM Encoder → 256speaker embedding

文本 → Tacotron+GST → mel 频谱图 → HiFi-GAN → 波形

核心问题:

  • 每个新说话人都要重新训练 synthesizer,没有真正意义上的零样本能力
  • 三段模型需要独立训练和调优,部署复杂度高
  • 只支持中文普通话
  • 没有流式合成
  • 自回归生成,速度慢

和现在的方案对比:

能力 MockingBird 新一代项目
克隆所需数据 数小时音频 + 数小时训练 3-10 秒(零样本)/ 1 分钟(微调)
语言 中文普通话 中英日韩粤 + 多方言
推理延迟 秒级 150ms 流式首包
模型结构 3 个独立模型 统一端到端
音质 中等 高(接近真人)
可控性 GST 全局风格 指令级情感/语速/韵律控制

结论是:如果你现在还在用 MockingBird,是时候迁移了。


选型建议

按场景推荐

需求 首选 备选 说明
个人开发,快速跑通 GPT-SoVITS ChatTTS 社区最大,教程多,1分钟数据微调
工业级部署,多语言 CosyVoice 3.0 Fish Speech 阿里长期维护,功能最全,流式延迟低
对话机器人/客服 ChatTTS CosyVoice 专门优化对话韵律
学术研究/复现论文 MaskGCT F5-TTS 均为 ICLR 2025,非自回归最新架构
商用(许可证干净) CosyVoice / Fish Speech GPT-SoVITS 避开 AGPLv3 和 CC BY-NC-SA
GPU 资源有限 GPT-SoVITS ChatTTS 较轻量,社区有 CPU 推理方案
粤语/方言 CosyVoice 3.0 GPT-SoVITS 18+ 方言支持

从 MockingBird 迁移路线图

1
2
3
4
5
6
7
8
9
10
11
12
13
当前:MockingBird (SV2TTS)

├── 想要最顺滑的迁移?
└── GPT-SoVITS(社区大、有整合包、WebUI 体验类似)

├── 需要多语言 / 工业部署?
└── CosyVoice 3.0(功能最全、阿里长期维护)

├── 主要做对话场景?
└── ChatTTS(韵律自然、专门对话优化)

└── 想跟进最新技术架构?
└── MaskGCT(非自回归前沿,ICLR 2025

硬件参考

项目 最低 GPU 推荐 GPU 模型大小 显存估算
CosyVoice 3.0 RTX 3060 RTX 4090 ~2GB 4-8 GB
GPT-SoVITS GTX 1660 RTX 3080 ~1GB 2-6 GB
ChatTTS GTX 1060 RTX 3060 ~1GB 2-4 GB
MaskGCT RTX 3090 RTX 4090 ~3GB 8-16 GB
F5-TTS RTX 3060 RTX 4090 ~2GB 4-8 GB
Fish Speech RTX 3060 RTX 4090 ~2GB 4-8 GB

以上为估算值,实际取决于推理配置、量化选项和输入长度。量化版本普遍能砍掉 30-50% 的显存占用。


快速入门流程

环境准备

1
2
3
4
5
6
7
8
# 前置条件
# - CUDA Toolkit(推荐 11.8 或 12.x)
# - conda / miniconda
# - GPU 驱动正常

# 验证
nvidia-smi
python -c "import torch; print(torch.cuda.is_available())"

安装示例(以 GPT-SoVITS 为例)

1
2
3
4
5
6
git clone https://github.com/RVC-Boss/GPT-SoVITS.git
cd GPT-SoVITS
conda create -n gptsovits python=3.10
conda activate gptsovits
pip install -r requirements.txt
python webui.py

参考音频要求

1
2
3
4
- 格式:WAV(16kHz 或 48kHz,视项目要求)
- 时长:零样本 3-10 秒,微调 1-5 分钟
- 质量:清晰、无背景音乐、单人说话
- 内容:尽量覆盖多种语调,避免只有单一情绪

合成流程

1
2
3
4
5
6
7
8
9
10
零样本模式(5 分钟跑通):
1. 上传参考音频
2. 输入要合成的文本
3. 点击合成,试听效果

微调模式(效果更稳):
1. 准备 1-5 分钟目标说话人音频
2. 自动标注(ASR 转文字 + 手动校对)
3. 训练(通常 5-30 分钟)
4. 用训练好的模型推理

附录:资源汇总

项目 GitHub 论文 文档/社区
CosyVoice 3.0 FunAudioLLM/CosyVoice arXiv GitHub Wiki
GPT-SoVITS RVC-Boss/GPT-SoVITS B 站教程丰富
ChatTTS 2noise/ChatTTS GitHub Issues
MaskGCT amphion/MaskGCT arXiv Amphion 文档
F5-TTS SWivid/F5-TTS arXiv GitHub README
Fish Speech fishaudio/fish-speech 官方文档
Seed-TTS BytedanceSpeech/seed-tts-eval arXiv 仅评估代码

说明:文中的 benchmark 数据来自各项目官方论文和仓库,未经过独立标准化对比测试。语音质量这件事主观因素很强,建议自己拿实际数据跑一遍再做决策。这个领域发展很快,几个月内排名就可能变化。


2025-2026 前沿开源语音克隆项目横评:从 MockingBird 到零样本时代
https://www.xuwx.top/2026/06/23/2025-2026-前沿开源语音克隆项目横评/
作者
Shine_ssr
发布于
2026年6月23日
许可协议