首页 / 开源 · 图像 / 音频 / Fish-Speech
🐟

Fish-Speech

fishaudio
⭐ 31k开源免费

效果很好的开源 TTS 配音,能克隆音色。

它能帮你做什么

解读

Fish-Speech 是效果很好的开源 TTS(文字转语音)配音模型,能生成自然的中英文语音,还能克隆音色——喂它一小段某人的声音,它就能用相似的嗓音念你给的文字。

适合做视频配音、有声书、口播小说等有声内容,尤其是想要一个固定、免费的配音「嗓子」。生成的语音比很多老式 TTS 自然得多。

门槛偏高:要 Python,最好有 GPU,还要下模型。只偶尔配几句、怕麻烦,用在线 TTS(剪映 / 微软 / ElevenLabs)更快;想免费本地批量配、或要克隆音色再上它。

适合谁

要做配音 / 有声内容、且愿意折腾本地部署的人。需要 Python,最好有 GPU。只偶尔配几句、怕麻烦的,用剪映 / 微软在线 TTS 或 ElevenLabs 更省事。

开始前的准备

手把手教程

  1. 装环境:按官网 speech.fish.audio 文档装好 Python 依赖。
  2. 下模型:下载它的模型文件(国内去魔搭 ModelScope 找)。
  3. 启界面:启动它自带的网页界面(WebUI)。
  4. 输文字:在界面里输入要转成语音的文字。
  5. (可选)克隆音色:上传一段参考音频,让它模仿这个嗓音。
  6. 生成 & 下载:点生成,试听满意后下载音频。

常见问题 / 踩坑

只想简单配句音,值得装吗?
不太值。偶尔配音用剪映、微软在线 TTS 或 ElevenLabs 更快。它适合免费本地批量、或要克隆特定音色。
克隆音色合法吗?
只克隆自己的声音、或已获授权的声音,别拿它伪造他人声音,注意法律和平台规则。
没 GPU 行吗?
能跑但慢。追求效率建议有 NVIDIA 显卡。
中文自然吗?
是它的强项之一,中文效果不错,明显好过老式机械音。

进阶技巧

打不开 GitHub / 国内访问

模型从国内「魔搭 ModelScope」下载即可,官网 speech.fish.audio。有一定门槛,追求省事可先用在线 TTS(剪映 / 微软 / ElevenLabs)。

同类还有

← 返回全部工具