Audio en texte
Transformez un fichier audio ou vidéo en transcription horodatée et téléchargez-la en sous-titres.
Cliquez sur une ligne pour aller à ce moment de l'audio.
Comment utiliser Audio en texte
- Déposez un fichier audio ou vidéo — MP3, WAV, M4A, OGG, MP4 et bien d'autres fonctionnent.
- Choisissez la langue parlée, ou laissez la détection automatique.
- Cliquez sur Transcrire et patientez pendant l'exécution du modèle.
- Lisez les lignes horodatées, cliquez sur l'une d'elles pour entendre ce moment, puis téléchargez TXT, SRT ou VTT.
À propos de Audio en texte
Cet outil transforme un fichier audio ou vidéo en texte, avec un horodatage sur chaque ligne. Déposez un enregistrement, choisissez la langue dans laquelle il est parlé, et vous obtenez une transcription découpée en courts segments minutés : cliquez sur une ligne et le lecteur saute à ce moment, si bien que vérifier un mot contre l'enregistrement prend une seconde au lieu d'une recherche.
L'horodatage est la raison pour laquelle cet outil est distinct de Voix en texte, qui vous donne un bloc de texte et peut aussi enregistrer directement au micro. Utilisez celui-là pour la dictée et les notes rapides. Utilisez celui-ci quand le minutage compte : sous-titrer une vidéo, citer un entretien avec sa position dans l'enregistrement, ou découper un long podcast en sections. En plus du texte brut, vous pouvez télécharger des fichiers de sous-titres SRT et VTT, ce qu'attendent YouTube, Vimeo, VLC et tous les logiciels de montage.
Tout s'exécute dans votre navigateur avec le modèle de reconnaissance vocale Whisper. Le fichier est décodé et transcrit sur votre propre appareil — il n'est jamais téléversé, ce qui compte quand l'enregistrement est un appel client, une note médicale ou un entretien sous embargo. Seul le modèle est téléchargé, une fois, et ensuite les fichiers suivants démarrent immédiatement. Les longs enregistrements prennent plus de temps et un téléphone sera plus lent qu'un ordinateur portable : commencez par quelques minutes pour juger de la vitesse avant d'engager une heure d'audio.
Questions fréquentes
Quels formats audio et vidéo fonctionnent ?
Tous ceux que votre navigateur sait décoder, ce qui couvre MP3, WAV, M4A, AAC, OGG, FLAC, WebM et MP4. Pour un fichier vidéo, la bande son est utilisée et l'image ignorée : vous pouvez donc sous-titrer une vidéo sans en extraire l'audio au préalable.
Quelle est la différence entre SRT et VTT ?
Ils contiennent la même chose, presque de la même façon. SRT numérote chaque sous-titre et sépare les secondes des millisecondes par une virgule ; VTT commence par une ligne WEBVTT et utilise un point. Prenez SRT pour YouTube et la plupart des logiciels de montage, VTT pour la vidéo HTML5 sur une page web. Les deux sont proposés pour vous éviter une conversion.
Mon audio est-il envoyé quelque part ?
Non. La transcription s'exécute dans votre navigateur, sur votre machine. La seule chose récupérée sur le réseau est le modèle vocal, une fois, et il est servi depuis ce site et non par un tiers.
Dois-je choisir la langue ?
Non — la détection automatique convient à la plupart des enregistrements. Choisir explicitement la langue aide quand l'audio est bruité, quand la personne a un accent marqué, ou quand quelques mots anglais apparaissent dans un discours dans une autre langue, ce qui est la cause habituelle d'une transcription qui change de langue en cours de route.
Quelle est sa précision, et quelle longueur de fichier ?
Une parole claire se transcrit bien ; un fort bruit de fond, plusieurs personnes parlant en même temps ou un enregistrement très faible coûteront en précision. Il n'y a pas d'autre limite de durée que 1 Go, mais le travail se fait sur votre appareil : un fichier long sur un téléphone peut prendre du temps. Traitez le résultat comme un premier jet à relire, pas comme un document fini.

