文案提取器
把音视频里的语音自动转成文字。
把文件拖到这里,或点击选择
MP3、WAV、M4A、MP4、WEBM…(含语音的音视频) · 支持批量
转换引擎直接在浏览器内运行(WebAssembly)——快、不排队、不用等上传。
关于文案提取器
把音视频里的语音自动转成文字。文件会上传到云端,由 OpenAI Whisper AI 模型(运行在 Cloudflare 边缘网络)转写,导出为纯文本或 SRT 字幕文件。无需麦克风。
对清晰的语音、较好的录音质量和单人说话效果最好。语言自动检测(支持 99+ 种语言)——在上方下拉框里选对语言可明显提升准确率。中文输出可一键切换为简体。
使用技巧
- 免费版单文件上限 25MB——长音频建议压成 16kHz 单声道 MP3(如用 ffmpeg)或切成较短片段。
- 转写前先选对语言(如「中文」或 English)比自动检测更准。
- 中文音频勾选「简体中文」后,会自动把繁体/地区用语转为大陆简体。
- 识别在云端完成(Whisper large-v3)——准确率高,不需要麦克风或浏览器语音引擎。
- 背景音乐或较大噪音会降低准确率;干净的录音识别效果好得多。
- SRT 输出带约 5 秒一段的粗略时间戳,多数播放器可直接加载。
- 录音质量比格式更重要——干净的 16kHz 播客音轨比嘈杂的 48kHz 识别效果好得多。
- 标点和数字由模型自动添加,但专有名词和技术术语建议快速人工校对一遍。
- 访谈或问答场景最好分开逐人转录——Whisper 单声道识别效果最佳。