Skip to content

本软件涉及所有模型和下载地址

本页面列出所有用到的模型下载地址、下载后本地存放位置,若自动下载总是失败,可先删掉已下载的模型文件,然后尝试手动下载。

为减小软件体积,不内置任何模型,将在第一次使用时自动在线下载,主要从国外模型仓库huggingface.co、国内镜像站hf-mirror.com和 阿里魔塔modelscope.cn下载

模型体积普遍较大(1G-5G),除了部分阿里模型位于国内阿里魔塔modelscope.cn网站,其他均位于国外网站huggingface.co,而此站国内已屏蔽,无法直接访问, 需科学上网(VPN/代理),无科学上网时软件内部会自动切换至国内镜像站hf-mirror.com

即便已科学上网,但若是(VPN/代理)不够稳定可靠,长时间持续下载仍可能失败;

而国内镜像站下载较慢、有频率限制,仍有较大概率下载失败。

以上种种原因导致模型下载频频失败,很多其他错误也多由模型下载失败后间接引发。

软件目录是指sp.exesp.py所在的文件夹

下载注意事项

一般每个模型都有多个文件组成,而不同模型可能存在相同名字的文件,例如大多都存在model.safetensors,如果你下载目录下已存在同名文件,浏览器可能为自动为你重命名,例如你下载的是model.safetensors,可能被自动命名为model(2).safetensors,你必须重新改回原名,然后放到要求的存放位置,软件才能识别到。

在 huggingface.co 网站,点击下载图标,即可下载该模型文件

语音识别渠道所用模型

Qwen-ASR(内置)

0.6B模型:

1.7B模型:

CN-Dialect模型(中文方言优化版):

Firered中文(内置)

Dolphin(内置)

Omnilingual亚洲语言(内置)

parakeet日语(内置)

Moss-Diarize(内置)

faster-whisper(内置)

模型名称本地存放位置下载地址
tiny软件目录/modles/models--Systran--faster-whisper-tinyhttps://huggingface.co/Systran/faster-whisper-tiny/tree/main
base软件目录/modles/models--Systran--faster-whisper-basehttps://huggingface.co/Systran/faster-whisper-base/tree/main
small软件目录/modles/models--Systran--faster-whisper-smallhttps://huggingface.co/Systran/faster-whisper-small/tree/main
medium软件目录/modles/models--Systran--faster-whisper-mediumhttps://huggingface.co/Systran/faster-whisper-medium/tree/main
large-v1软件目录/modles/models--Systran--faster-whisper-large-v1https://huggingface.co/Systran/faster-whisper-large-v1/tree/main
large-v2软件目录/modles/models--Systran--faster-whisper-large-v2https://huggingface.co/Systran/faster-whisper-large-v2/tree/main
large-v3软件目录/modles/models--Systran--faster-whisper-large-v3https://huggingface.co/Systran/faster-whisper-large-v3/tree/main
large-v3-turbo软件目录/modles/models--mobiuslabsgmbh--faster-whisper-large-v3-turbohttps://huggingface.co/mobiuslabsgmbh/faster-whisper-large-v3-turbo/tree/main
------------------------------------------
tiny.en软件目录/modles/models--Systran--faster-whisper-tiny.enhttps://huggingface.co/Systran/faster-whisper-tiny.en/tree/main
base.en软件目录/modles/models--Systran--faster-whisper-base.enhttps://huggingface.co/Systran/faster-whisper-base.en/tree/main
small.en软件目录/modles/models--Systran--faster-whisper-small.enhttps://huggingface.co/Systran/faster-whisper-small.en/tree/main
medium.en软件目录/modles/models--Systran--faster-whisper-medium.enhttps://huggingface.co/Systran/faster-whisper-medium.en/tree/main
------------------------------------------
distil-large-v2软件目录/modles/models--Systran--faster-distil-whisper-large-v2https://huggingface.co/Systran/faster-distil-whisper-large-v2/tree/main
distil-large-v3软件目录/modles/models--Systran--faster-distil-whisper-large-v3https://huggingface.co/Systran/faster-distil-whisper-large-v3/tree/main
distil-large-v3.5软件目录/modles/models--distil-whisper--distil-large-v3.5-ct2https://huggingface.co/distil-whisper/distil-large-v3.5-ct2/tree/main
distil-small.en软件目录/modles/models--Systran--faster-distil-whisper-small.enhttps://huggingface.co/Systran/faster-distil-whisper-small.en/tree/main
distil-medium.en软件目录/modles/models--Systran--faster-distil-whisper-medium.enhttps://huggingface.co/Systran/faster-distil-whisper-medium.en/tree/main

openai-whisper(内置)

下载后的.pt模型文件直接放在 软件目录/models 文件夹内即可

HuggingFace_ASR(内置)

显示的模型名称为

  • Audio8/ARK-ASR-0.6B 支持中英等10多种语言识别
  • Audio8/ARK-ASR-3B 支持中英等10多种语言识别
  • zai-org/GLM-ASR-Nano-2512 支持中英识别
  • ibm-granite/granite-speech-4.1-2b 支持法英德西班牙
  • nvidia/parakeet-ctc-1.1b 英语
  • reazon-research/japanese-wav2vec2-large-rs35kh 日语
  • kotoba-tech/kotoba-whisper-v2.0 日语
  • vinai/Phowhisper-large 越南语
  • nguyenvulebinh/wav2vec2-base-vietnamese-250h 越南语
  • biodatlab/whisper-th-large-v3 泰语
  • sakares/wav2vec2-large-xlsr-thai-demo 泰语
  • SiangLao/xlsr-53-lao-asr 老挝语
  • chuuhtetnaing/whisper-large-v3-myanmar 缅甸语
  • 1morecupofhottea/whisper-turbo-khmer-v9 柬埔寨高棉语
  • anke01/whisper-small-uyghur 维吾尔语
  • billingsmoore/tibetan-asr-nict-tib1-whisper-small 藏语
  • kingabzpro/whisper-large-v3-urdu 乌尔都语
  • vasista22/whisper-tamil-small 泰米尔语
  • theainerd/Wav2Vec2-large-xlsr-hindi 印地语
  • cautroi/whisper-large-v3-id 印尼语
  • Khalsuu/filipino-wav2vec2-l-xls-r-300m-official 菲律宾
  • navai-uz/whisper-medium-uzbek 乌兹别克语
  • MohammadKhosravi/whisper-large-v3-Persian 波斯语
  • Ghost3454/translynx-pakistani-punjabi-whisper-small 巴基斯坦旁遮普语
  • turkmedstt/whisper-large-v3-turkish-general 土耳其语
  • anton-l/wav2vec2-large-xlsr-53-mongolian 蒙古语
  • openai/whisper-large-v3 所有内置语言

例如显示名称是 Audio8/ARK-ASR-0.6B

那么下载地址就是https://huggingface.co/Audio8/ARK-ASR-0.6B/tree/main, 存放位置就是 软件目录/models/models--Audio8--ARK-ASR-0.6B

看到规律了吗?下载地址就是直接使用模型显示名称替换,存放位置也是替换,并将显示名称中的/ 斜线改为--

whisper.cpp

单文件模型,下载后将 .bin 文件放入 软件目录/models 文件夹内。



翻译渠道(字幕翻译)所用模型

Hy-MT2-1.8B(内置)

M2M100(内置)



配音渠道所用模型

Piper(内置)

VITS(内置)

ZipVoice(内置)

OmniVoice(内置)

MOSS-TTS-Nano(内置)

ChatterBox(内置)

ChatterBox 第一次使用除了模型外,还需要从 github.com 下载2个文件到 models文件夹内,如果下载失败,请手动从该地址下载 https://github.com/explosion/spacy-pkuseg/releases/download/v0.0.26/spacy_ontonotes.zip,下载后解压,会得到2个文件,分别是features.msgpackweights.npz,将他们复制到软件目录/models/pkuser_home 内,如果不存在该文件夹,请新建

Supertonic(内置)

Higgs-audio-v3(内置)

Qwen3-TTS(内置)

Confucius-TTS(内置)

F5-TTS(内置)

存放位置: 软件目录/models/models--SWivid--F5-TTS/F5TTS_v1_Base

存放位置: 软件目录/models/models--Jmica--F5TTS/JA_21999120

存放位置: 软件目录/models/models--RASPIAUDIO--F5-French-MixedSpeakers-reduced

存放位置: 软件目录/models/models--hvoss-techfak--F5-TTS-German

存放位置: 软件目录/models/models--hotstone228--F5-TTS-Russian

存放位置: 软件目录/models/models--alien79--F5-TTS-italian

存放位置: 软件目录/models/models--jpgallegoar--F5-Spanish

存放位置: 软件目录/models/models--SPRINGLab/F5-Hindi-24KHz

存放位置: 软件目录/models/models--silma-ai--silma-tts

存放位置: 软件目录/models/models--multilingual-tts--F5-TTS-OpenBible-Turkish

存放位置: 软件目录/models/models--multilingual-tts--F5-TTS-OpenBible-Vietnamese



说话人分离模型

内置模型:

在该地址页下载3dspeaker_speech_eres2net_large_sv_zh-cn_3dspeaker_16k.onnxnemo_en_titanet_small.onnxseg_model.onnx 这3个文件

  • 存放位置:软件目录/models/onnx/将下载的3个文件放到此处

pyannote

Ali camp++:

分离人声背景模型、降噪模型、标点恢复模型

下载地址:https://modelscope.cn/models/himyworld/videotrans/tree/master/onnx 存放位置:下载该页面所有 .onnx 文件后存放到 软件目录/models/onnx/ 文件夹内

实时语音识别模型