Sonorarium
← Retour au blog

Comment transcrire un audio en texte (gratuitement, en quelques minutes) — Guide 2026

Transcrire à la main une heure d'audio prend 4 à 6 heures. Avec un bon modèle de reconnaissance vocale, le même travail se fait en quelques minutes et il ne vous reste qu'à relire. Ce guide explique comment faire gratuitement, quels formats utiliser et comment obtenir la meilleure précision.

1. Préparez le fichier

Presque tous les enregistrements conviennent : MP3, WAV, M4A, OGG, OPUS, FLAC, MP4, MOV ou WEBM. Aucune conversion nécessaire : pour une vidéo, nous extrayons l'audio automatiquement.

  • Un vocal WhatsApp ? Enregistrez-le depuis la discussion (appui long → Partager → Enregistrer dans Fichiers) et importez-le tel quel. Voir notre guide pour transcrire des audios WhatsApp.
  • Une réunion Zoom ou Teams ? Téléchargez l'enregistrement et importez le fichier audio (M4A) pour aller plus vite.
  • Une vidéo pour les réseaux ou YouTube ? Importez-la directement, puis téléchargez les sous-titres. Plus d'infos : transcrire une vidéo en texte.

2. Importez l'audio et choisissez la langue

Ouvrez l'outil gratuit et déposez le fichier. La langue est détectée automatiquement, mais la choisir vous-même (par exemple le français) améliore légèrement la précision, surtout au début ou en présence d'une musique d'introduction.

Vous pouvez transcrire jusqu'à 10 minutes par jour sans inscription et recevez 30 minutes gratuites en créant un compte.

3. Relisez et corrigez

L'IA reconnaît l'immense majorité des mots sur un audio de bonne qualité, mais vérifiez :

  • Noms propres et sigles : marques, noms de famille ou termes techniques rares.
  • Passages bruyants : circulation, musique de fond ou personnes parlant en même temps.
  • Chiffres : contrôlez les montants importants en réécoutant l'extrait.

Dans l'éditeur, cliquez sur une phrase pour entendre le moment exact de l'audio et corrigez ce qu'il faut.

4. Téléchargez dans le format voulu

  • Word (DOCX) : rapports, procès-verbaux ou entretiens retranscrits.
  • TXT : texte brut à coller partout.
  • SRT et VTT : sous-titres horodatés pour YouTube, Premiere, DaVinci Resolve ou CapCut. Essayez notre générateur de sous-titres SRT.
  • JSON : horodatage par segment, pour les développeurs.

Conseils pour une transcription plus précise

  1. Enregistrez près de la source : un téléphone à 30 cm de l'orateur vaut mieux qu'un enregistreur coûteux au fond de la salle.
  2. Évitez le bruit de fond : fermez les fenêtres, coupez ventilateurs et musique.
  3. Une personne à la fois : les interruptions provoquent le plus d'erreurs.
  4. Utilisez une bonne qualité : un MP3 à 128 kbit/s ou plus suffit largement.

Combien ça coûte ?

En plus des minutes gratuites, vous pouvez acheter des packs de minutes sans abonnement : vous payez une fois et les minutes n'expirent jamais. Voir les tarifs.

Questions fréquentes

Et la confidentialité de mes enregistrements ? Les fichiers sont transférés chiffrés, supprimés automatiquement après 7 jours et jamais utilisés pour entraîner des modèles.

Puis-je transcrire d'autres langues ? Oui, plus de 60, comme l'anglais ou l'espagnol.