首页 / 开源 · 图像 / 音频 / Whisper
🎙️

Whisper

OpenAI
⭐ 104k开源免费

最强开源语音转文字,扒素材、生成字幕很好用。

它能帮你做什么

解读

Whisper 是 OpenAI 开源的语音转文字模型,识别准、支持中英等近百种语言,能把音频 / 视频转成文字稿和字幕文件

对做自媒体的人特别有用:把一段播客、视频、录音丢给它,几分钟就得到全文文字稿——扒选题素材、生成字幕、把口播转成文章,都靠它。而且完全免费、本地运行、内容不外传。

命令行版要装 Python,稍有门槛;但也有基于它的傻瓜桌面软件,甚至剪映的字幕识别原理都类似,怕麻烦可以走那条路。

适合谁

做自媒体、做视频、要整理录音 / 访谈的人。命令行版需要一点 Python 基础;怕麻烦的可以用基于它的桌面软件(如 Buzz)或剪映,效果类似、零门槛。

开始前的准备

手把手教程

  1. 装环境:装好 Python,再装 ffmpeg(Mac brew install ffmpeg;Windows 下载 ffmpeg 并加进 PATH)。
  2. 装 Whisper:运行 pip install -U openai-whisper(国内加清华源)。
  3. 转文字:命令行运行 whisper 音频.mp3 --language Chinese
  4. 拿结果:它会自动输出 txt(纯文字)、srt(字幕)等文件。
  5. 选精度:加 --model medium 换更准的模型,越大越准越慢(首次会下模型)。
  6. 想更快 / 更省事:用 faster-whisper(快数倍),或直接用桌面软件 Buzz 拖文件转。

常见问题 / 踩坑

完全不会命令行怎么办?
用桌面软件「Buzz」——它就是 Whisper 的图形版,拖入文件点转录即可;或直接用剪映的「字幕识别」,原理类似、零门槛。
中文准吗?
挺准,记得加 --language Chinese。想更准用大一点的模型(medium/large),但更慢、更吃配置。
太慢了?
faster-whisper(速度快数倍),或用小一点的模型;有 NVIDIA 显卡会快很多。
要联网吗?
首次下载模型要联网,之后本地运行、离线可用,内容不外传。

进阶技巧

打不开 GitHub / 国内访问

pip 用清华源加速;怕配环境就用桌面软件 Buzz(Whisper 图形版),或直接用剪映的字幕识别,零门槛、国内可用。

同类还有

← 返回全部工具