GPT-SoVITS语音克隆完整实战指南:5秒零样本、1分钟微调克隆你的声音

GPT-SoVITS语音克隆完整实战指南:5秒零样本、1分钟微调克隆你的声音 GPT-SoVITS语音克隆完整实战指南5秒零样本、1分钟微调克隆你的声音【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITSGPT-SoVITS 是一个开源的少样本语音克隆与文本转语音TTS项目核心价值在于你只需提供 5 秒的干净人声样本它就能以对方的音色朗读任意文本零样本语音克隆如果再提供 1 分钟左右的录音做微调音色相似度和自然度还能进一步提升。全程通过 WebUI 点选即可完成本文带你从零把它跑起来。 快速了解GPT-SoVITS 能做什么先看功能清单明确它能解决什么问题能力说明你需要准备零样本语音克隆输入 5 秒参考人声即刻以该音色合成语音一段干净录音少样本微调用约 1 分钟训练数据微调模型音色更像本人1 分钟以上录音跨语言合成推理文本可与训练集不同语言支持中文、英文、日文、韩文、粤语对应语言文本一体化 WebUI 工具内置人声伴奏分离UVR5、音频自动切片、多语种语音识别ASR、文本标注校对无与同类 TTS 项目相比它的差异点在于底模经过大规模数据预训练v2 底模已扩展至 5k 小时所以不训练直接推底模也能得到可用的音色克隆效果而微调只是锦上添花。官方给出的推理速度RTF即合成耗时与音频时长的比值数据v2 ProPlus 底模在 RTX 4090 上约 0.0141400 字≈4 分钟音频合成耗时 3.36 秒RTX 4060 Ti 约 0.028M4 CPU 约 0.526。️ 环境准备GPT-SoVITS 一键安装步骤官方测试通过的环境组合如下安装脚本会自动处理 PyTorch、Gradio 界面和音频处理依赖Python 版本PyTorch 版本运行设备3.10 / 3.112.5.1CUDA 12.43.11 / 3.92.7.0 / 2.8.0devCUDA 12.83.9 / 3.112.5.1 / 2.7.0Apple silicon3.92.2.2CPULinux / macOS 一键安装macOS 因 GPU 训练质量偏低官方暂时用 CPU/MPS 训练git clone https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS cd GPT-SoVITS conda create -n GPTSoVits python3.10 conda activate GPTSoVits bash install.sh --device CU128 --source HF--device可选CU126 | CU128 | ROCM | CPUmacOS 为MPS | CPU--source可选HF | HF-Mirror | ModelScope国内网络建议用ModelScope加--download-uvr5可顺带下载人声分离模型Windows 用户最简单的方式是下载官方整合包解压后双击go-webui.bat直接启动无需任何命令行操作。install.sh运行成功后预训练模型、G2PW 中文文本处理模型等都已就位可跳过手动下载步骤。若手动安装核心依赖只需两行pip install -r extra-req.txt --no-deps pip install -r requirements.txt另外务必安装 FFmpegconda install ffmpeg或sudo apt install ffmpeg否则音频读写会报错。 最小闭环跑通你的第一个语音克隆按编号走完这 5 步你就能听到第一句用克隆音色合成的话启动主界面项目根目录执行python webui.py浏览器会自动打开 WebUI。也可以单独启动推理界面python GPT_SoVITS/inference_webui.py。零样本试音无需任何训练进入1-GPT-SoVITS-TTS→1C-推理页签模型选不训练直接推 v2Pro 底模上传一段 5 秒左右的参考音频填入这段音频对应的话prompt 文本再输入要合成的目标文本点击合成。这样就能立刻得到目标音色的语音。准备微调数据进入微调页签填入训练音频的目录路径。自动处理流水线依次点击切割音频 →可选降噪 → ASR 语音识别 → 校对标注。系统会把长音频切成适合训练的短片段并自动生成文本标注你只需在标注界面改掉识别错的字。训练集格式为音频路径|说话人|语言|文本语言码zh中文 /en英文 /ja日文 /ko韩文 /yue粤语。训练并推理切到训练窗口点击训练先训 GPT 再训 SoVITS各几十秒到几分钟不等训练产物保存在GPT_weights、SoVITS_weights等目录。回到1C-推理选中新训练的权重即可体验比零样本更像本人的效果。⚙️ 核心机制剖析为什么 5 秒声音就能克隆GPT-SoVITS 把合成拆成两级理解这条链路你就明白了它为什么这么工作文本前端把输入文本做规范化和分词按语种拆分成中文、英文、日文等片段支持中英日混合分别转成拼音/音素序列。相关代码在 GPT_SoVITS/text/中文依赖 G2PW 多音字模型。s1GPT 语义模型一个自回归语言模型以文本音素 BERT 语义特征为输入逐 token 生成一段语义 token——它是内容的离散表示不含音色。参考音频则通过说话人向量Eres2Net和自身语义 token 注入音色条件。正因为音色与内容在这里解耦5 秒音频携带的音色信息就足以驱动任意长度的新文本。s2SoVITS 声码器把语义 token 还原成梅尔频谱再转为波形。v3 起采用流匹配解码器v3/v4 的声码器为 BigVGANGPT_SoVITS/BigVGAN/。微调为什么有效零样本靠条件注入猜音色微调含 LoRA 轻量微调见 GPT_SoVITS/s2_train_v3_lora.py则是让 s1、s2 两个模型的参数真正记住这个人的音色细节所以 1 分钟数据就能显著提升相似度。各阶段代码分别在 GPT_SoVITS/AR/models/s1、GPT_SoVITS/module/s2、GPT_SoVITS/TTS_infer_pack/推理封装。训练/推理的默认超参数定义在 GPT_SoVITS/configs/如s1big2.yaml默认 epochs 300、batch_size 12、16-mixed 混合精度。 问题排查高频现象—原因—解决方案现象启动或训练时报显存不足OOM。原因单精度运行或批次过大。解决方案在 GPT_SoVITS/configs/tts_infer.yaml 中把is_half设为trueDocker 场景设环境变量is_half训练时调小s1big2.yaml中的batch_size显存紧张优先选 v2 系列版本。现象合成音频发闷或有金属音。原因v3 原生输出 24kHz且非整数倍上采样会引入金属感。解决方案换用 v4原生 48kHz 输出官方视为 v3 的直接替代或保留 v3 并开启超分super_sampling参数基于 AP-BWE 的 24k→48k 模型见 tools/AP_BWE_main/24kto48k/。现象合成结果漏字、重复字。原因自回归采样偶发循环或参考音频质量差。解决方案通过 API 参数调节repetition_penalty默认 1.35、top_k、temperaturev3/v4 底模本身重复漏字更少参考音频尽量用 5 秒以上的干净人声。现象报错 FFmpeg 找不到或路径报错。原因未安装 FFmpeg路径含特殊字符官方注明日文训练要求根目录不含特殊字符。解决方案安装 FFmpeg项目与音频统一放在纯英文路径下。现象中文 TTS 读错多音字。原因G2PW 模型未就位。解决方案确认GPT_SoVITS/text/G2PWModel目录存在install.sh正常跑完会自动处理。 进阶玩法参数调优与版本选择版本怎么选基于官方发布说明版本特点适用场景v1最早版本资源占用最低低配设备兜底v2底模扩至 5k 小时对低音质参考音频容忍度高训练集音质一般时首选v2Pro / v2ProPlus音质超过 v4速度保持 v2 水平显存略高于 v2追求音质但显存有限v3音色相似度更高、漏字更少、情感更丰富原生 24kHz需要最像本人的效果v4修复 v3 金属音原生 48kHz追求高音质v3 的直接替代注意官方结论训练集平均音质较低时 v1/v2/v2Pro 效果更好v3/v4 则更适合高质量数据且合成音色更贴近参考音频。API 服务需要程序化调用时用 api_v2.py 起一个 HTTP 服务/tts接口一次可控制十余个参数python api_v2.py -a 127.0.0.1 -p 9880 -c GPT_SoVITS/configs/tts_infer.yamlPOST 请求中值得关注的参数top_k/top_p/temperature控制发音稳定性与随机性、speed_factor语速、seed复现结果、sample_stepsv3 流匹配步数、streaming_mode流式返回音频分片0~3 档数字越大延迟越低、batch_size与parallel_infer批量合成提速。其他优化点CPU 推理会自动强制单精度半精度不兼容的显卡也会自动降级无需手动干预Docker 部署可选 Lite 镜像不含 UVR5/ASR 模型Windows 下记得在docker-compose.yaml把shm_size调大到16g无本地显卡时可直接用仓库里的 Colab-WebUI.ipynb 在云端训练 实际应用场景个人有声内容录 1 分钟自己的声音为播客、有声笔记固定一个标准音轨零样本模式适合快速验证某段文案的听感。多语言内容制作利用跨语言推理同一份参考音频可产出中、英、日、韩、粤多语言版本适合出海短剧、多语言教学材料的配音。游戏与互动产品为 NPC 批量生成台词。多说话人场景可通过 API 的aux_ref_audio_paths参数融合多个参考音频的音色特征。 生态与资源官方文档docs/cn/README.md中文完整说明、docs/en/Changelog_EN.md 及日文/韩文/土耳其文变更日志关键源码路径文本前端GPT_SoVITS/text/s1 语义模型GPT_SoVITS/AR/models/s2 声码器与特征提取GPT_SoVITS/module/、GPT_SoVITS/feature_extractor/推理入口GPT_SoVITS/inference_webui.py、api_v2.py训练脚本GPT_SoVITS/s1_train.py、GPT_SoVITS/s2_train.py、特征预处理 GPT_SoVITS/prepare_datasets/配套工具人声分离 tools/uvr5/、语音识别 tools/asr/Fun-ASR-Nano / SenseVoice / FunASR / Faster Whisper、切片 tools/slice_audio.py、音频超分 tools/audio_sr.py预训练模型目录GPT_SoVITS/pretrained_models/社区渠道项目 Issues 页问题反馈与功能请求、Colab 在线体验脚本✍️ 收尾现在就动手试两个任务零样本体验找一段 5 秒的干净人声自己或朋友在1C-推理页签用不训练直接推 v2Pro 底模合成一段 100 字文案再切一次跨语言组合中文参考音频 英文文本。微调闭环录 1 分钟自己的说话素材走一遍切片 → ASR → 校对 → 训练 → 推理对比训练前后同一段文本的音色差异。提示参考音频的干净程度直接决定克隆效果上限——安静环境、单声道、无背景音5 秒就够。先零样本跑通、再微调加深是这条路上最省时的顺序。【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考