Impact-Site-Verification: e6550553-7571-4143-825a-7f8817120a2b
Skip to main content
GhostConvert 幽灵转换 · 全能转换
Wiki
📝

文案提取器

把音视频里的语音自动转成文字。

📥

把文件拖到这里,或点击选择

MP3、WAV、M4A、MP4、WEBM…(含语音的音视频) · 支持批量

转换引擎直接在浏览器内运行(WebAssembly)——快、不排队、不用等上传。

关于文案提取器

把音视频里的语音自动转成文字。文件会上传到云端,由 OpenAI Whisper AI 模型(运行在 Cloudflare 边缘网络)转写,导出为纯文本或 SRT 字幕文件。无需麦克风。

对清晰的语音、较好的录音质量和单人说话效果最好。语言自动检测(支持 99+ 种语言)——在上方下拉框里选对语言可明显提升准确率。中文输出可一键切换为简体。

使用技巧

  • 免费版单文件上限 25MB——长音频建议压成 16kHz 单声道 MP3(如用 ffmpeg)或切成较短片段。
  • 转写前先选对语言(如「中文」或 English)比自动检测更准。
  • 中文音频勾选「简体中文」后,会自动把繁体/地区用语转为大陆简体。
  • 识别在云端完成(Whisper large-v3)——准确率高,不需要麦克风或浏览器语音引擎。
  • 背景音乐或较大噪音会降低准确率;干净的录音识别效果好得多。
  • SRT 输出带约 5 秒一段的粗略时间戳,多数播放器可直接加载。
  • 录音质量比格式更重要——干净的 16kHz 播客音轨比嘈杂的 48kHz 识别效果好得多。
  • 标点和数字由模型自动添加,但专有名词和技术术语建议快速人工校对一遍。
  • 访谈或问答场景最好分开逐人转录——Whisper 单声道识别效果最佳。