MP3 · WAV · M4A · FLAC → TXT · SRT · VTT

音频转文字

在浏览器中转录采访、播客、讲座录音和语音备忘。编辑文本并导出 TXT、SRT 或 VTT。

选择录音中实际使用的语言,与页面语言无关。

首次使用需要联网,从 Hugging Face 下载 Whisper 语音模型,并从第三方 jsDelivr CDN 下载AI 运行组件;浏览器可能缓存这些文件。请保持页面打开,处理速度取决于设备性能。

音频和转录文本保留在当前设备,不会上传。

首次使用需要联网,从 Hugging Face 下载 Whisper 语音模型,并从第三方 jsDelivr CDN 下载AI 运行组件;浏览器可能缓存这些文件。请保持页面打开,处理速度取决于设备性能。

请核对结果,识别准确率不作保证;暂不支持说话人识别。 本工具不进行翻译、摘要或说话人分离。

三步将录音转为文字

  1. 1

    选择音频

    从设备中选择语音清晰的录音文件。

  2. 2

    转录音频

    选择录音中实际使用的语言,开始本地转录。

  3. 3

    下载 TXT

    核对并编辑文本,再复制或下载。

转录文本的用途

  • 将采访录音整理为可搜索的文字。
  • 为播客制作文字稿,方便编辑和阅读。
  • 复习讲座录音,或将语音备忘整理成笔记。

常见问题

录音会上传吗?

音频和转录文本保留在当前设备,不会上传。 首次使用需要联网,从 Hugging Face 下载 Whisper 语音模型,并从第三方 jsDelivr CDN 下载AI 运行组件;浏览器可能缓存这些文件。请保持页面打开,处理速度取决于设备性能。

支持哪些录音文件?

每次一个音频文件,最大 100 MiB、最长 5 分钟。支持格式: MP3, M4A, WAV, AAC, OGG, OGA, Opus, FLAC, WebM, WebA.

应该选择什么语言?

选择录音中实际使用的语言,与页面语言无关。

转录准确吗?

请核对结果,识别准确率不作保证;暂不支持说话人识别。 本工具不进行翻译、摘要或说话人分离。

选择区域

选择您的首选语言和地区

音频转文字 – TXT, SRT, VTT | videotolink