GPT-SoVITS:少样本声音克隆与语音合成全流程实战

GPT-SoVITS:少样本声音克隆与语音合成全流程实战

大模型

📖 简介

GPT-SoVITS 是强大的少样本声音克隆工具,仅需 5 秒参考音频就能复刻音色并合成高质量中文语音。45k+ Stars,一键训练、WebUI 可视化操作,配音与语音创作的开源利器。

📝 详细介绍

这篇教程带你完成什么

从零部署开源项目 GPT-SoVITS,用一段 5-10 秒的参考音频克隆任意人声,合成指定文本的语音文件。最终你有一个能跑的 Web 界面,以及一个能通过 API 接入业务的 TTS 服务。

前置条件

  • Python 3.9 或 3.10,低于 3.8 跑不起来
  • conda 或 venv,用来隔离依赖环境
  • NVIDIA GPU 且显存 ≥8GB,纯 CPU 能跑但慢到怀疑人生
  • ffmpeg,音频处理依赖它,缺失会在启动时报错
  • 能访问 GitHub 和 HuggingFace,模型权重从这两个地方下载
  • 一段≥5秒、单人说话、无背景音乐的参考音频(MP3/WAV 均可)

安装部署

1. 克隆项目并创建环境

这一步要做什么:把仓库拉下来,建一个独立的 Python 环境,安装依赖。

git clone https://github.com/RVC-Boss/GPT-SoVITS.git
cd GPT-SoVITS
conda create -n gpt-sovits python=3.9 -y
conda activate gpt-sovits
pip install -r requirements.txt

2. 下载预训练模型

GPT-SoVITS 的少样本能力依赖两个预训练权重:GPT 模型和 SoVITS 模型。项目提供了自动下载脚本,它会把这些权重放到 pretrained_models 目录下。这步要有梯子,否则会很痛苦。

python tools/download.py

3. 启动 Web 界面

这是标准的 Gradio 应用,端口默认 9874,启动后浏览器访问即可。

python webui.py --port 9874

打开 http://localhost:9874,看到界面就成功了。现在你可以做第一个真正有用的 Demo。

第一个 Demo:零样本声音克隆

这个 Demo 不需要训练,用预训练模型 + 一段参考音频直接克隆音色。从上传音频到出声,大约 30 秒。

第 1 步:进入推理页签,选择零样本模式

WebUI 默认停在"推理"页签,页面上方有模式下拉框,选 0-零样本推理。没有这个选项说明预训练权重没下载完整,回头重新跑 tools/download.py

第 2 步:上传参考音频并填文本

左侧填入参考音频和它的原文逐字稿。注意"参考音频的原文"必须和音频内容一字不差,这是模型对齐音素和音色的关键。右侧的目标文本是你要合成的最终内容。

上传后界面会自动提取音频特征,观察参考音频波形是否正常显示。常见的失败是这个波形刷不出来——多半是音频路径含中文或空格,建议把素材放到纯英文路径下。

🚀

AI 项目推荐

大模型
标签
#语音合成 #声音克隆 #TTS #少样本
浏览
👁️ 46
发布日期
2026-08-10