Vídeo a texto
Transcribe el habla de un vídeo local en tu navegador. Edita, copia o exporta el texto como TXT, SRT y VTT.
Elige el idioma del vídeo; es independiente del idioma de la página.
El primer uso descarga un modelo de voz con IA. Mantén esta pestaña abierta; la velocidad depende de tu dispositivo. Los archivos del modelo se descargan del servicio externo Hugging Face y pueden guardarse en la caché del navegador. El primer uso requiere Internet; en móviles puede tardar más.
El vídeo y el audio permanecen en tu dispositivo; no se suben.
El primer uso descarga un modelo de voz con IA. Mantén esta pestaña abierta; la velocidad depende de tu dispositivo. Los archivos del modelo se descargan del servicio externo Hugging Face y pueden guardarse en la caché del navegador. El primer uso requiere Internet; en móviles puede tardar más.
Revisa el resultado: no se garantiza la precisión. No se admite la identificación de hablantes.
Transcribe un vídeo en tres pasos
- 1
Elegir vídeo
Elige un vídeo local que contenga habla.
- 2
Transcribir vídeo
Elige el idioma hablado e inicia la transcripción local con IA.
- 3
Descargar TXT
Revisa y edita el texto, y después cópialo o descárgalo.
Usos de la transcripción
- Crear un borrador de subtítulos.
- Convertir una clase en apuntes.
- Preparar una transcripción de entrevista que se pueda buscar.
Preguntas frecuentes
¿Se sube mi vídeo?
El vídeo y el audio permanecen en tu dispositivo; no se suben. El primer uso descarga un modelo de voz con IA. Mantén esta pestaña abierta; la velocidad depende de tu dispositivo. Los archivos del modelo se descargan del servicio externo Hugging Face y pueden guardarse en la caché del navegador. El primer uso requiere Internet; en móviles puede tardar más.
¿Qué vídeos se admiten?
Un archivo MP4, MOV o WebM, de hasta 100 MB y 5 minutos. El navegador debe admitir su códec de audio.
¿Qué idioma debo elegir?
Elige el idioma del vídeo; es independiente del idioma de la página.
¿Es precisa la transcripción?
Revisa el resultado: no se garantiza la precisión. No se admite la identificación de hablantes.