语音转字幕:Whisper 自动上字幕
24.10.29 版起,Shotcut 内置了语音转文字:基于 OpenAI 的 Whisper 模型(whisper.cpp 实现),把视频里的人声自动转成字幕轨。免费剪辑器里自带 AI 字幕的,它是先行者。
三步生成
- 视频放上时间线
- 字幕面板里点「检测语音」(Detect speech…)按钮
- 等任务跑完——面板会创建两个任务(导出音频 + 转文字),结果自动成为一条新的字幕轨
模型选择
- 软件自带一个基础模型,速度与准确度平衡,体积小
- 对话框里可以指定更大的 ggml 格式模型(官方文档给了获取渠道),识别更准但更慢
- 语言要选对——中文素材就选 Chinese,识别质量直接取决于这一步
中文用户的实测注意点
- 自带基础模型识别中文,结果里可能出现简体字;需要繁体的用户一般导出 SRT 后用文本工具转码,再导回来
- 时间轴偶有提前起跳的情况——官方文档坦承时间由模型决定,属于已知现象,手动微调即可
- 识别基本只吃 CPU 多线程(GPU 加速目前限 Apple Silicon),长视频第一次跑要有耐心
转完之后
生成的字幕轨可以逐条校对、改时间,然后二选一交付:导出 SRT 做软字幕,或直接印进画面,见字幕烧录。字幕轨的日常管理见字幕面板。
功能可能随版本变化,以官方最新版为准。生成的字幕轨怎么管理、怎么导入导出,见字幕面板。