首页 / 开源 · 图像 / 音频 / video-use
🎞️

video-use

browser-use
⭐ 15k开源免费

用 Codex / Claude Code 剪视频:丢进素材,聊几句,出成片。

它能帮你做什么

解读

video-use 是 browser-use 团队开源的「用 AI 剪视频」工具,玩法很反直觉:你把原始素材丢进一个文件夹,然后像聊天一样跟 Claude Code / Codex 说要什么,它就还你一个剪好的 final.mp4

它最聪明的地方是——AI 根本不「看」画面,而是「读」视频:先用 ElevenLabs Scribe 把音频转成带精确时间戳的逐字稿(连「呃」「嗯」这种废词都标出来),AI 基于文字决定剪哪、留哪。所以它能精准剪掉废词和停顿、自动调色、每个切口加 30ms 音频淡入、烧上字幕。

因为走「文字骨架」,它比传统 AI 剪辑省下巨量 token。适合口播、教程、访谈、Vlog 这类以说话为主的视频。

适合谁

做口播、教程、访谈类视频,想大幅提速粗剪的人。需要装 Claude Code/Codex + ffmpeg + 一个 ElevenLabs key,有一点动手能力;纯不懂技术的可先用 Opus Clip 这类现成产品。

开始前的准备

手把手教程

  1. 装 agent:确保有 Claude Code 或 Codex 能用。
  2. 装依赖:把 video-use 仓库克隆进 agent 的 skills 目录,用 uv sync 或 pip 装依赖;装好 ffmpeg。
  3. 配 key:填入你的 ElevenLabs API Key(做逐字转录用)。
  4. 丢素材:把原始视频放进一个文件夹。
  5. 聊需求:跟 Claude Code 说「剪掉所有废词和停顿、加字幕、调色、导出竖版」。
  6. 取成片:等它转录 → 按文字剪 → ffmpeg 合成,给你 final.mp4

常见问题 / 踩坑

AI 真能看懂视频画面吗?
它不看画面,是「读」——把音频转成带时间戳的逐字稿,基于文字来剪。所以对口播 / 说话类视频最准,纯画面叙事的弱一些。
一定要 ElevenLabs 吗?
转录默认用 ElevenLabs Scribe(精度高、带词级时间戳),它是这套精准剪辑的关键。
要写代码吗?
不用写代码,但要会装环境、用命令行跑 agent,有点门槛。怕麻烦用 Opus Clip 这类现成工具。
和剪映比?
剪映是手动为主;video-use 是「描述需求→自动粗剪」,适合把去废词、对字幕这类重复粗剪自动化,精修仍回剪映。

进阶技巧

打不开 GitHub / 国内访问

克隆仓库慢加 ghproxy.com/;ffmpeg 国内直接装。ElevenLabs 是境外服务,需自行解决访问和付费。

同类还有

← 返回全部工具