首页 / 开源 · 图像 / 音频 / video-use
🎞️
video-use
browser-use
用 Codex / Claude Code 剪视频:丢进素材,聊几句,出成片。
它能帮你做什么
- 把原始素材丢进文件夹,跟 AI 聊几句就得到剪好的成片
- 自动剪掉「呃 / 嗯 / 口误」这些废词和镜头间的停顿
- 自动调色、每个切口加音频淡入(消爆音)、烧字幕
- 口播 / 教程 / 访谈 / Vlog 这类说话为主的视频尤其合适
解读
video-use 是 browser-use 团队开源的「用 AI 剪视频」工具,玩法很反直觉:你把原始素材丢进一个文件夹,然后像聊天一样跟 Claude Code / Codex 说要什么,它就还你一个剪好的 final.mp4。
它最聪明的地方是——AI 根本不「看」画面,而是「读」视频:先用 ElevenLabs Scribe 把音频转成带精确时间戳的逐字稿(连「呃」「嗯」这种废词都标出来),AI 基于文字决定剪哪、留哪。所以它能精准剪掉废词和停顿、自动调色、每个切口加 30ms 音频淡入、烧上字幕。
因为走「文字骨架」,它比传统 AI 剪辑省下巨量 token。适合口播、教程、访谈、Vlog 这类以说话为主的视频。
适合谁
做口播、教程、访谈类视频,想大幅提速粗剪的人。需要装 Claude Code/Codex + ffmpeg + 一个 ElevenLabs key,有一点动手能力;纯不懂技术的可先用 Opus Clip 这类现成产品。
开始前的准备
- 一个 coding agent:Claude Code / Codex / Hermes / OpenClaw 都行。
- 装好
ffmpeg(必需),可选yt-dlp。 - 一个 ElevenLabs API Key(用来做逐字转录)。
- 你的原始视频素材。
手把手教程
- 装 agent:确保有 Claude Code 或 Codex 能用。
- 装依赖:把 video-use 仓库克隆进 agent 的 skills 目录,用
uv sync或 pip 装依赖;装好 ffmpeg。 - 配 key:填入你的 ElevenLabs API Key(做逐字转录用)。
- 丢素材:把原始视频放进一个文件夹。
- 聊需求:跟 Claude Code 说「剪掉所有废词和停顿、加字幕、调色、导出竖版」。
- 取成片:等它转录 → 按文字剪 → ffmpeg 合成,给你
final.mp4。
常见问题 / 踩坑
AI 真能看懂视频画面吗?
它不看画面,是「读」——把音频转成带时间戳的逐字稿,基于文字来剪。所以对口播 / 说话类视频最准,纯画面叙事的弱一些。
一定要 ElevenLabs 吗?
转录默认用 ElevenLabs Scribe(精度高、带词级时间戳),它是这套精准剪辑的关键。
要写代码吗?
不用写代码,但要会装环境、用命令行跑 agent,有点门槛。怕麻烦用 Opus Clip 这类现成工具。
和剪映比?
剪映是手动为主;video-use 是「描述需求→自动粗剪」,适合把去废词、对字幕这类重复粗剪自动化,精修仍回剪映。
进阶技巧
- 它适合「粗剪自动化」:先让它去废词、对字幕,再导进剪映精修,效率最高。
- 素材音频越清晰,转录和剪辑越准。
打不开 GitHub / 国内访问
克隆仓库慢加
ghproxy.com/;ffmpeg 国内直接装。ElevenLabs 是境外服务,需自行解决访问和付费。