Herramientas de Texto

Audio a texto

Convierte un archivo de audio o vídeo en una transcripción con marcas de tiempo y descárgala como subtítulos.

Valora esta herramienta

Cómo usar Audio a texto

  1. Suelta un archivo de audio o vídeo — MP3, WAV, M4A, OGG, MP4 y muchos más funcionan.
  2. Elige el idioma hablado, o deja la detección automática.
  3. Haz clic en Transcribir y espera mientras se ejecuta el modelo.
  4. Lee las líneas con marca de tiempo, haz clic en cualquiera para oír ese momento y descarga TXT, SRT o VTT.

Acerca de Audio a texto

Esta herramienta convierte un archivo de audio o vídeo en texto con una marca de tiempo en cada línea. Suelta una grabación, elige el idioma en que está hablada y recibirás una transcripción dividida en segmentos cortos con su tiempo: haz clic en cualquier línea y el reproductor salta a ese momento, así que comprobar una palabra contra la grabación lleva un segundo en vez de una búsqueda.

Las marcas de tiempo son la razón de que esté separada de Voz a texto, que te da un bloque de texto y además puede grabar directamente desde el micrófono. Usa aquella para dictado y notas rápidas. Usa esta cuando importe el tiempo: subtitular un vídeo, citar una entrevista con la posición en la grabación o dividir un pódcast largo en secciones. Junto al texto plano puedes descargar archivos de subtítulos SRT y VTT, que es lo que esperan YouTube, Vimeo, VLC y cualquier editor de vídeo.

Todo se ejecuta dentro de tu navegador con el modelo de voz Whisper. El archivo se decodifica y se transcribe en tu propio dispositivo — nunca se sube, que es lo importante cuando la grabación es una llamada con un cliente, una nota médica o una entrevista bajo embargo. Solo se descarga el modelo, una vez, y después los archivos siguientes empiezan de inmediato. Las grabaciones largas tardan más y un móvil será más lento que un portátil, así que empieza con unos minutos si quieres ver la velocidad antes de comprometer una hora de audio.

Preguntas frecuentes

¿Qué formatos de audio y vídeo funcionan?

Cualquiera que tu navegador pueda decodificar, lo que cubre MP3, WAV, M4A, AAC, OGG, FLAC, WebM y MP4. En un archivo de vídeo se usa la pista de sonido y se ignora la imagen, así que puedes subtitular un vídeo sin exportar antes el audio.

¿Cuál es la diferencia entre SRT y VTT?

Contienen lo mismo casi de la misma forma. SRT numera cada subtítulo y separa los segundos de los milisegundos con una coma; VTT empieza con una línea WEBVTT y usa un punto. Usa SRT para YouTube y la mayoría de editores de vídeo, y VTT para vídeo HTML5 en una página web. Se ofrecen los dos para que no tengas que convertir uno en otro.

¿Se sube mi audio a algún sitio?

No. La transcripción se ejecuta en tu navegador, en tu propia máquina. Lo único que se descarga por la red es el modelo de voz, una vez, y se sirve desde este sitio y no desde un tercero.

¿Tengo que elegir el idioma?

No — la detección automática funciona con casi todas las grabaciones. Elegir el idioma explícitamente ayuda cuando el audio tiene ruido, cuando el hablante tiene un acento marcado o cuando aparecen algunas palabras en inglés dentro de un discurso en otro idioma, que es la causa habitual de una transcripción que cambia de idioma a mitad.

¿Cómo de precisa es, y de qué duración puede ser el archivo?

El habla clara se transcribe bien; mucho ruido de fondo, varias personas hablando a la vez o una grabación muy baja restan precisión. No hay más límite de duración que 1 GB, pero el trabajo ocurre en tu dispositivo, así que un archivo largo en un móvil puede tardar. Trata el resultado como un primer borrador que revisas, no como un documento terminado.