首页 / 开源 · 图像 / 音频 / Fish-Speech
🐟
Fish-Speech
fishaudio
效果很好的开源 TTS 配音,能克隆音色。
它能帮你做什么
- 把文字转成自然的中英文语音,做视频配音、有声书
- 克隆音色:用一段参考音频,生成相似嗓音的配音
- 本地免费批量配音,不受在线服务的额度 / 收费限制
- 给自媒体做一个统一的口播「声线」
解读
Fish-Speech 是效果很好的开源 TTS(文字转语音)配音模型,能生成自然的中英文语音,还能克隆音色——喂它一小段某人的声音,它就能用相似的嗓音念你给的文字。
适合做视频配音、有声书、口播小说等有声内容,尤其是想要一个固定、免费的配音「嗓子」。生成的语音比很多老式 TTS 自然得多。
门槛偏高:要 Python,最好有 GPU,还要下模型。只偶尔配几句、怕麻烦,用在线 TTS(剪映 / 微软 / ElevenLabs)更快;想免费本地批量配、或要克隆音色再上它。
适合谁
要做配音 / 有声内容、且愿意折腾本地部署的人。需要 Python,最好有 GPU。只偶尔配几句、怕麻烦的,用剪映 / 微软在线 TTS 或 ElevenLabs 更省事。
开始前的准备
- 一台电脑,最好带 NVIDIA 显卡。
- 装好 Python 环境。
- 按文档下载模型(国内走魔搭 ModelScope)。
- 想克隆音色:准备一小段清晰的参考音频。
手把手教程
- 装环境:按官网
speech.fish.audio文档装好 Python 依赖。 - 下模型:下载它的模型文件(国内去魔搭 ModelScope 找)。
- 启界面:启动它自带的网页界面(WebUI)。
- 输文字:在界面里输入要转成语音的文字。
- (可选)克隆音色:上传一段参考音频,让它模仿这个嗓音。
- 生成 & 下载:点生成,试听满意后下载音频。
常见问题 / 踩坑
只想简单配句音,值得装吗?
不太值。偶尔配音用剪映、微软在线 TTS 或 ElevenLabs 更快。它适合免费本地批量、或要克隆特定音色。
克隆音色合法吗?
只克隆自己的声音、或已获授权的声音,别拿它伪造他人声音,注意法律和平台规则。
没 GPU 行吗?
能跑但慢。追求效率建议有 NVIDIA 显卡。
中文自然吗?
是它的强项之一,中文效果不错,明显好过老式机械音。
进阶技巧
- 参考音频越清晰、无杂音,克隆出的音色越像。
- 长文分段生成再拼接,比一次性生成长音频更稳。
打不开 GitHub / 国内访问
模型从国内「魔搭 ModelScope」下载即可,官网 speech.fish.audio。有一定门槛,追求省事可先用在线 TTS(剪映 / 微软 / ElevenLabs)。