Áudio para texto
Transforme um ficheiro de áudio ou vídeo numa transcrição com marcas de tempo e transfira-a como legendas.
Clique em qualquer linha para saltar para esse momento do áudio.
Como usar Áudio para texto
- Largue um ficheiro de áudio ou vídeo — MP3, WAV, M4A, OGG, MP4 e muitos mais funcionam.
- Escolha o idioma falado, ou deixe na deteção automática.
- Clique em Transcrever e aguarde enquanto o modelo corre.
- Leia as linhas com marca de tempo, clique em qualquer uma para ouvir esse momento e transfira TXT, SRT ou VTT.
Sobre Áudio para texto
Esta ferramenta transforma um ficheiro de áudio ou vídeo em texto com uma marca de tempo em cada linha. Largue uma gravação, escolha o idioma em que é falada e receberá uma transcrição dividida em segmentos curtos com o respetivo tempo — clique em qualquer linha e o leitor salta para esse momento, por isso confirmar uma palavra contra a gravação demora um segundo em vez de uma procura.
As marcas de tempo são a razão pela qual esta ferramenta é separada de Voz para texto, que lhe dá um bloco de texto e também consegue gravar diretamente do microfone. Use essa para ditado e notas rápidas. Use esta quando o tempo importa: legendar um vídeo, citar uma entrevista com a posição na gravação, ou dividir um podcast longo em secções. Além do texto simples pode transferir ficheiros de legendas SRT e VTT, que é o que o YouTube, o Vimeo, o VLC e qualquer editor de vídeo esperam.
Tudo corre dentro do seu navegador com o modelo de voz Whisper. O ficheiro é descodificado e transcrito no seu próprio dispositivo — nunca é enviado, o que é o essencial quando a gravação é uma chamada com um cliente, uma nota clínica ou uma entrevista sob embargo. Apenas o modelo é transferido, uma vez, e depois disso os ficheiros seguintes começam de imediato. Gravações longas demoram mais e um telemóvel será mais lento do que um portátil, por isso comece com alguns minutos se quiser ver a velocidade antes de avançar com uma hora de áudio.
Perguntas frequentes
Que formatos de áudio e vídeo funcionam?
Qualquer um que o seu navegador consiga descodificar, o que cobre MP3, WAV, M4A, AAC, OGG, FLAC, WebM e MP4. Num ficheiro de vídeo é usada a faixa de som e a imagem é ignorada, por isso pode legendar um vídeo sem exportar primeiro o áudio.
Qual é a diferença entre SRT e VTT?
Guardam a mesma coisa quase da mesma forma. O SRT numera cada legenda e separa os segundos dos milissegundos com uma vírgula; o VTT começa com uma linha WEBVTT e usa um ponto. Use SRT para o YouTube e a maioria dos editores de vídeo, e VTT para vídeo HTML5 numa página web. Ambos são oferecidos para não ter de converter um no outro.
O meu áudio é enviado para algum lado?
Não. A transcrição corre no seu navegador, na sua própria máquina. A única coisa obtida pela rede é o modelo de voz, uma vez, e é servido a partir deste site e não de terceiros.
Tenho de escolher o idioma?
Não — a deteção automática dá conta da maioria das gravações. Escolher o idioma explicitamente ajuda quando o áudio tem ruído, quando o orador tem um sotaque forte, ou quando surgem algumas palavras em inglês num discurso noutra língua, que é a causa habitual de uma transcrição que muda de idioma a meio.
Qual é a precisão, e que duração pode ter o ficheiro?
Fala clara transcreve bem; muito ruído de fundo, várias pessoas a falar ao mesmo tempo ou uma gravação muito baixa custam precisão. Não há limite de duração além de 1 GB, mas o trabalho acontece no seu dispositivo, por isso um ficheiro longo num telemóvel pode demorar. Trate o resultado como um primeiro rascunho que revê, não como um documento acabado.

