MP3 · WAV · M4A · FLAC → TXT · SRT · VTT

音訊轉文字

在瀏覽器中轉錄訪談、Podcast、講座錄音和語音備忘。編輯逐字稿並匯出 TXT、SRT 或 VTT。

選擇錄音實際使用的語言,與頁面語言無關。

首次使用需要連網,從 Hugging Face 下載 Whisper 語音模型,並從第三方 jsDelivr CDN 下載AI 執行元件;瀏覽器可能快取這些檔案。請保持頁面開啟,處理速度取決於裝置效能。

音訊和逐字稿保留在目前裝置,不會上傳。

首次使用需要連網,從 Hugging Face 下載 Whisper 語音模型,並從第三方 jsDelivr CDN 下載AI 執行元件;瀏覽器可能快取這些檔案。請保持頁面開啟,處理速度取決於裝置效能。

請核對結果,辨識準確率不作保證;暫不支援說話者辨識。 本工具不進行翻譯、摘要或說話者分離。

三步將錄音轉為文字

  1. 1

    選擇音訊

    從裝置中選擇語音清晰的錄音檔案。

  2. 2

    轉錄音訊

    選擇錄音實際使用的語言,開始本機轉錄。

  3. 3

    下載 TXT

    核對並編輯文字,再複製或下載。

逐字稿的用途

  • 將訪談錄音整理為可搜尋的文字。
  • 為 Podcast 製作逐字稿,方便編輯和閱讀。
  • 複習講座錄音,或將語音備忘整理成筆記。

常見問題

錄音會上傳嗎?

音訊和逐字稿保留在目前裝置,不會上傳。 首次使用需要連網,從 Hugging Face 下載 Whisper 語音模型,並從第三方 jsDelivr CDN 下載AI 執行元件;瀏覽器可能快取這些檔案。請保持頁面開啟,處理速度取決於裝置效能。

支援哪些錄音檔案?

每次一個音訊檔案,最大 100 MiB、最長 5 分鐘。支援格式: MP3, M4A, WAV, AAC, OGG, OGA, Opus, FLAC, WebM, WebA.

應該選擇什麼語言?

選擇錄音實際使用的語言,與頁面語言無關。

轉錄準確嗎?

請核對結果,辨識準確率不作保證;暫不支援說話者辨識。 本工具不進行翻譯、摘要或說話者分離。

選擇區域

選擇您的首選語言和地區

音訊轉文字 – TXT, SRT, VTT | videotolink