音频转文字
把音频或视频文件转成带时间戳的文字稿,并下载为字幕。
点击任意一行即可跳到音频中的该位置。
如何使用 音频转文字
- 拖入音频或视频文件——MP3、WAV、M4A、OGG、MP4 等都支持。
- 选择说话所用的语言,或保持自动识别。
- 点击“转写”,等待模型运行。
- 查看带时间戳的每一行,点击任意一行即可听到那个片段,然后下载 TXT、SRT 或 VTT。
关于 音频转文字
本工具把音频或视频文件转成文字,并给每一行标上时间戳。拖入一段录音,选择它所用的语言,你会得到一份被切分成若干带时间小段的文字稿——点击任意一行,播放器就会跳到那个位置,核对某个词只需一秒,而不用来回找。
时间戳正是它与语音转文字分开的原因:那个工具给出的是一整段文字,还能直接用麦克风录音,适合口述和快速记笔记。而当时间点很重要时——给视频配字幕、引用采访并标明在录音中的位置、把长播客分成章节——就用这个。除了纯文本,你还可以下载 SRT 和 VTT 字幕文件,这正是 YouTube、Vimeo、VLC 和各类视频剪辑软件所需要的格式。
全部处理都在你的浏览器里用 Whisper 语音模型完成。文件在你自己的设备上解码和转写——绝不会被上传,当录音是客户通话、医疗记录或尚未公开的采访时,这一点尤其重要。只有模型本身会被下载一次,之后再处理文件都是立即开始。较长的录音需要更久,手机也会比笔记本慢,所以如果想先看看速度,可以从几分钟的片段开始,再决定是否处理一小时的音频。
常见问题
支持哪些音频和视频格式?
凡是你的浏览器能解码的都可以,包括 MP3、WAV、M4A、AAC、OGG、FLAC、WebM 和 MP4。对于视频文件,只使用其中的声音轨道、忽略画面,所以你可以直接给视频配字幕,无需先导出音频。
SRT 和 VTT 有什么区别?
两者装的内容几乎一样。SRT 会给每条字幕编号,并用逗号分隔秒和毫秒;VTT 以 WEBVTT 开头,用点号分隔。给 YouTube 和大多数剪辑软件用 SRT,给网页上的 HTML5 视频用 VTT。两种都提供,省得你再做一次转换。
我的音频会被上传吗?
不会。转写在你的浏览器、你自己的机器上运行。通过网络获取的只有语音模型,而且只取一次,并且由本站提供,而不是第三方。
必须选语言吗?
不必——自动识别能应付大多数录音。当音频有噪声、说话者口音较重,或者非英语的讲话中夹杂了几个英文词时,明确指定语言会更稳妥;后者正是转写稿中途“换语言”的常见原因。
准确度如何?文件能有多长?
清晰的讲话转写效果不错;背景噪声大、多人同时说话,或录音音量过低,都会降低准确度。除了 1 GB 之外没有时长限制,但处理是在你的设备上进行的,所以手机上处理长文件可能会比较久。请把结果当作需要通读一遍的初稿,而不是可以直接交付的成品。

