Vídeo para texto
Transcreva a fala de um vídeo local no navegador. Edite, copie ou exporte o texto em TXT, SRT e VTT.
Escolha o idioma do vídeo, independentemente do idioma da página.
A primeira utilização descarrega um modelo de voz com IA. Mantenha o separador aberto; a velocidade depende do dispositivo. Os ficheiros do modelo são descarregados do serviço externo Hugging Face e podem ficar na cache do navegador. A primeira utilização exige Internet; em dispositivos móveis pode demorar mais.
O vídeo e o áudio ficam no seu dispositivo; não são enviados.
A primeira utilização descarrega um modelo de voz com IA. Mantenha o separador aberto; a velocidade depende do dispositivo. Os ficheiros do modelo são descarregados do serviço externo Hugging Face e podem ficar na cache do navegador. A primeira utilização exige Internet; em dispositivos móveis pode demorar mais.
Reveja o resultado: a precisão não é garantida. A identificação de oradores não é suportada.
Transcrever um vídeo em três passos
- 1
Escolher vídeo
Escolha um vídeo local com fala.
- 2
Transcrever vídeo
Escolha o idioma falado e inicie a transcrição local com IA.
- 3
Descarregar TXT
Reveja e edite o texto, depois copie ou descarregue.
Utilizações da transcrição
- Criar um rascunho de legendas.
- Transformar uma aula em apontamentos.
- Preparar uma transcrição pesquisável de uma entrevista.
Perguntas frequentes
O meu vídeo é enviado?
O vídeo e o áudio ficam no seu dispositivo; não são enviados. A primeira utilização descarrega um modelo de voz com IA. Mantenha o separador aberto; a velocidade depende do dispositivo. Os ficheiros do modelo são descarregados do serviço externo Hugging Face e podem ficar na cache do navegador. A primeira utilização exige Internet; em dispositivos móveis pode demorar mais.
Que vídeos são suportados?
Um ficheiro MP4, MOV ou WebM, até 100 MB e 5 minutos. O navegador deve suportar o codec de áudio.
Que idioma devo escolher?
Escolha o idioma do vídeo, independentemente do idioma da página.
A transcrição é precisa?
Reveja o resultado: a precisão não é garantida. A identificação de oradores não é suportada.