配音渠道
配音(TTS)是视频翻译的第三步,将翻译后的字幕文本转换为语音音频。pyVideoTrans 支持 30+ 种配音渠道。
开箱即用(免费)
无需复杂配置,非常适合新手。
| 渠道 | 说明 | 推荐度 |
|---|---|---|
| Edge-TTS(免费) | 微软免费接口,声音自然,支持所有语种 | ⭐⭐⭐ 默认推荐 |
| gTTS(免费) | Google TTS,基础质量,国内需科学上网 | ⭐⭐ |
⚠️ Edge-TTS 短时间内大量使用可能触发限流,建议在高级选项中将并发数设为 1,暂停秒数设为 5-10。
本地内置(免费)
首次使用时自动下载模型。
因国内网络环境问题,加之模型都比较巨大,自动下载有可能失败,如果失败,请参考下方手动下载方式
OmniVoice模型下载失败:手动打开地址 https://huggingface.co/k2-fsa/OmniVoice/tree/main 将所有文件下载后放到
软件目录/models/models--k2-fsa--OmniVoice文件夹内MOSS-TTS-Nano模型下载失败:手动打开地址 https://huggingface.co/OpenMOSS-Team/MOSS-TTS-Nano-100M/tree/main 将所有文件下载后放到
软件目录/models/models--OpenMOSS-Team--MOSS-TTS-Nano-100M文件夹内ChatterBox模型下载失败:手动打开地址 https://huggingface.co/ResembleAI/chatterbox/tree/main 将所有文件下载后放到
软件目录/models/chatterbox文件夹内supertonic模型下载失败:手动打开地址 https://huggingface.co/Supertone/supertonic-3/tree/main 将所有文件下载后放到
软件目录/models/models--Supertone--supertonic-3文件夹内Piper模型下载失败:手动打开地址 https://huggingface.co/rhasspy/piper-voices/tree/main 将所有文件下载后放到
软件目录/models/piper文件夹内Qwen-TTS模型下载失败:
打开 Base 模型下载页,将所有文件和文件夹下载后放到
软件目录/models/models--Qwen--Qwen3-TTS-12Hz-0.6B-Base文件夹内打开 CustomVoice 模型下载页,同样下载所有文件和文件夹到
软件目录/models/models--Qwen--Qwen3-TTS-12Hz-0.6B-CustomVoice文件夹内
专业云服务(需 API Key)
| 渠道 | 说明 | 推荐度 |
|---|---|---|
| Azure TTS | 微软专业级语音服务 | ⭐⭐⭐ |
| OpenAI TTS | 声音技术领先 | ⭐⭐⭐ |
| 字节语音合成2.0 | 中文发音地道 | ⭐⭐⭐ |
| 阿里 Qwen-TTS | 阿里云语音合成 | ⭐⭐⭐ |
| Gemini TTS | 谷歌 TTS | ⭐⭐ |
| Elevenlabs.io | AI 音频技术公司 | ⭐⭐⭐ |
| 302.AI | 聚合平台 | ⭐⭐ |
| Minimaxi | 需充值使用 | ⭐⭐ |
| 小米 TTS | 小米 AI 开放平台 | ⭐⭐ |
| X.AI TTS | x.ai 平台 | ⭐⭐ |
本地自行部署(高阶)
| 渠道 | 说明 | 支持克隆 | 推荐度 |
|---|---|---|---|
| GPT-SoVITS | 支持中英日韩粤 | ✅ | ⭐⭐⭐ 推荐 |
| Index-TTS | 中英 | ✅ | ⭐⭐⭐ 推荐 |
| Confucius-TTS | 中文、英文、日语、韩语、德语、法语、西班牙语、印尼语、意大利语、泰语、葡萄牙语、俄语、马来语、越南语 | ✅ | ⭐⭐⭐ |
| VoxCPM-TTS | 阿拉伯语、缅甸语、中文、丹麦语、荷兰语、英语、芬兰语、法语、德语、希腊语、希伯来语、印地语、印尼语、意大利语、日语、高棉语、韩语、老挝语、马来语、挪威语、波兰语、葡萄牙语、俄语、西班牙语、斯瓦希里语、瑞典语、他加禄语、泰语、土耳其语、越南语 | ✅ | ⭐⭐⭐ |
| CosyVoice | 中文、英语、日语、韩语、德语、西班牙语、法语、意大利语、俄语 | ✅ | ⭐⭐ |
| ChatTTS | 支持中英 | — | ⭐⭐ |
| Fish-TTS | 支持内置所有语言 | — | ⭐ |
| Kokoro-TTS | 中英韩意葡德法印地 | — | ⭐ |
| Spark-TTS | 中英 | ✅ | ⭐⭐ |
| clone-voice | 已不维护 | ✅ | ⭐ |
使用参考音频
参考音频统一在菜单 → TTS设置 → 设置参考音频中处理。
操作步骤
- 打开「参考音频」设置界面
- 在「参考音频」文本框中填写以下格式的内容:
音频文件名#该音频文件中对应的文字- 将参考音频文件放置在 pyVideoTrans 项目根目录下的
f5-tts文件夹内(如该文件夹不存在请手动创建)
示例
假设你有一个音频文件 nverguo.wav,音频内容是「女儿国王说话」,则填写:
nverguo.wav#女儿国王说话

参考音频要求
| 项目 | 要求 |
|---|---|
| 格式 | WAV 格式(推荐),MP3 等格式也可 |
| 时长 | 3~10 秒 |
| 内容 | 发音清晰,无背景噪音 |
| 文字 | 必须与音频内容一致 |
