Audio na tekst
Transkrybuj wywiady, podcasty, wykłady i notatki głosowe w przeglądarce. Edytuj tekst i eksportuj TXT, SRT lub VTT.
Wybierz język używany w nagraniu, niezależnie od języka strony.
Pierwsze użycie wymaga internetu do pobrania modelu Whisper z Hugging Face i komponentów AI z zewnętrznych jsDelivr CDN. Przeglądarka może je zapisać w pamięci podręcznej. Pozostaw kartę otwartą; szybkość zależy od urządzenia.
Audio i transkrypcja pozostają na urządzeniu i nie są przesyłane.
Pierwsze użycie wymaga internetu do pobrania modelu Whisper z Hugging Face i komponentów AI z zewnętrznych jsDelivr CDN. Przeglądarka może je zapisać w pamięci podręcznej. Pozostaw kartę otwartą; szybkość zależy od urządzenia.
Sprawdź wynik: dokładność nie jest gwarantowana. Rozpoznawanie mówców nie jest obsługiwane. Narzędzie nie tłumaczy, nie podsumowuje ani nie rozdziela mówców.
Transkrybuj nagranie w trzech krokach
- 1
Wybierz audio
Wybierz z urządzenia nagranie z wyraźną mową.
- 2
Transkrybuj audio
Wybierz język nagrania i rozpocznij lokalną transkrypcję.
- 3
Pobierz TXT
Sprawdź i edytuj tekst, a następnie skopiuj lub pobierz.
Zastosowania transkrypcji
- Zamień nagranie wywiadu w tekst z możliwością wyszukiwania.
- Przygotuj transkrypcje podcastów do edycji i poprawy dostępności.
- Powtórz nagrany wykład lub zamień notatki głosowe w tekst.
Częste pytania
Czy moje nagranie jest przesyłane?
Audio i transkrypcja pozostają na urządzeniu i nie są przesyłane. Pierwsze użycie wymaga internetu do pobrania modelu Whisper z Hugging Face i komponentów AI z zewnętrznych jsDelivr CDN. Przeglądarka może je zapisać w pamięci podręcznej. Pozostaw kartę otwartą; szybkość zależy od urządzenia.
Jakie nagrania audio mogę transkrybować?
Jeden plik audio, do 100 MiB i 5 minut. Obsługiwane formaty: MP3, M4A, WAV, AAC, OGG, OGA, Opus, FLAC, WebM, WebA.
Jaki język wybrać?
Wybierz język używany w nagraniu, niezależnie od języka strony.
Czy transkrypcja jest dokładna?
Sprawdź wynik: dokładność nie jest gwarantowana. Rozpoznawanie mówców nie jest obsługiwane. Narzędzie nie tłumaczy, nie podsumowuje ani nie rozdziela mówców.