GPT-SoVITS:少样本声音克隆与语音合成全流程实战
大模型
📖 简介
GPT-SoVITS 是强大的少样本声音克隆工具,仅需 5 秒参考音频就能复刻音色并合成高质量中文语音。45k+ Stars,一键训练、WebUI 可视化操作,配音与语音创作的开源利器。
📝 详细介绍
这篇教程带你完成什么
从零部署开源项目 GPT-SoVITS,用一段 5-10 秒的参考音频克隆任意人声,合成指定文本的语音文件。最终你有一个能跑的 Web 界面,以及一个能通过 API 接入业务的 TTS 服务。
前置条件
- Python 3.9 或 3.10,低于 3.8 跑不起来
- conda 或 venv,用来隔离依赖环境
- NVIDIA GPU 且显存 ≥8GB,纯 CPU 能跑但慢到怀疑人生
- ffmpeg,音频处理依赖它,缺失会在启动时报错
- 能访问 GitHub 和 HuggingFace,模型权重从这两个地方下载
- 一段≥5秒、单人说话、无背景音乐的参考音频(MP3/WAV 均可)
安装部署
1. 克隆项目并创建环境
这一步要做什么:把仓库拉下来,建一个独立的 Python 环境,安装依赖。
git clone https://github.com/RVC-Boss/GPT-SoVITS.git
cd GPT-SoVITS
conda create -n gpt-sovits python=3.9 -y
conda activate gpt-sovits
pip install -r requirements.txt
2. 下载预训练模型
GPT-SoVITS 的少样本能力依赖两个预训练权重:GPT 模型和 SoVITS 模型。项目提供了自动下载脚本,它会把这些权重放到 pretrained_models 目录下。这步要有梯子,否则会很痛苦。
python tools/download.py
3. 启动 Web 界面
这是标准的 Gradio 应用,端口默认 9874,启动后浏览器访问即可。
python webui.py --port 9874
打开 http://localhost:9874,看到界面就成功了。现在你可以做第一个真正有用的 Demo。
第一个 Demo:零样本声音克隆
这个 Demo 不需要训练,用预训练模型 + 一段参考音频直接克隆音色。从上传音频到出声,大约 30 秒。
第 1 步:进入推理页签,选择零样本模式
WebUI 默认停在"推理"页签,页面上方有模式下拉框,选 0-零样本推理。没有这个选项说明预训练权重没下载完整,回头重新跑 tools/download.py。
第 2 步:上传参考音频并填文本
左侧填入参考音频和它的原文逐字稿。注意"参考音频的原文"必须和音频内容一字不差,这是模型对齐音素和音色的关键。右侧的目标文本是你要合成的最终内容。
上传后界面会自动提取音频特征,观察参考音频波形是否正常显示。常见的失败是这个波形刷不出来——多半是音频路径含中文或空格,建议把素材放到纯英文路径下。
第
🚀
AI 项目推荐
大模型- 标签
- #语音合成 #声音克隆 #TTS #少样本
- 浏览
- 👁️ 46
- 发布日期
- 2026-08-10