首页 / 开源 · 图像 / 音频 / Whisper
🎙️
Whisper
OpenAI
最强开源语音转文字,扒素材、生成字幕很好用。
它能帮你做什么
- 把音频 / 视频转成文字稿:扒素材、做逐字稿、口播转文章
- 自动生成 srt 字幕文件,直接配到视频里
- 转录会议、访谈、播客,事后好检索
- 支持中英等多语言,还能顺带翻译成英文
解读
Whisper 是 OpenAI 开源的语音转文字模型,识别准、支持中英等近百种语言,能把音频 / 视频转成文字稿和字幕文件。
对做自媒体的人特别有用:把一段播客、视频、录音丢给它,几分钟就得到全文文字稿——扒选题素材、生成字幕、把口播转成文章,都靠它。而且完全免费、本地运行、内容不外传。
命令行版要装 Python,稍有门槛;但也有基于它的傻瓜桌面软件,甚至剪映的字幕识别原理都类似,怕麻烦可以走那条路。
适合谁
做自媒体、做视频、要整理录音 / 访谈的人。命令行版需要一点 Python 基础;怕麻烦的可以用基于它的桌面软件(如 Buzz)或剪映,效果类似、零门槛。
开始前的准备
- 命令行版:装好 Python,并安装 ffmpeg(处理音视频用)。
- 或:直接用桌面软件 Buzz(免装 Python)。
- 你要转录的音频 / 视频文件。
手把手教程
- 装环境:装好 Python,再装 ffmpeg(Mac
brew install ffmpeg;Windows 下载 ffmpeg 并加进 PATH)。 - 装 Whisper:运行
pip install -U openai-whisper(国内加清华源)。 - 转文字:命令行运行
whisper 音频.mp3 --language Chinese。 - 拿结果:它会自动输出
txt(纯文字)、srt(字幕)等文件。 - 选精度:加
--model medium换更准的模型,越大越准越慢(首次会下模型)。 - 想更快 / 更省事:用
faster-whisper(快数倍),或直接用桌面软件 Buzz 拖文件转。
常见问题 / 踩坑
完全不会命令行怎么办?
用桌面软件「Buzz」——它就是 Whisper 的图形版,拖入文件点转录即可;或直接用剪映的「字幕识别」,原理类似、零门槛。
中文准吗?
挺准,记得加
--language Chinese。想更准用大一点的模型(medium/large),但更慢、更吃配置。太慢了?
换
faster-whisper(速度快数倍),或用小一点的模型;有 NVIDIA 显卡会快很多。要联网吗?
首次下载模型要联网,之后本地运行、离线可用,内容不外传。
进阶技巧
- 自媒体扒选题:把对标视频的音频转成文字稿,快速吃透别人讲了啥。
- 生成的 srt 直接拖进剪辑软件就是字幕,省去手打。
打不开 GitHub / 国内访问
pip 用清华源加速;怕配环境就用桌面软件 Buzz(Whisper 图形版),或直接用剪映的字幕识别,零门槛、国内可用。