Transcrire un audio en texte en ligne — Whisper AI privé
Convertissez la parole de fichiers audio et vidéo en texte avec Whisper AI exécuté dans votre navigateur. Sans envoi, gratuit, avec copie et téléchargement TXT.
🔒 S'exécute entièrement dans votre navigateur — rien n'est téléchargéDe la parole au texte sans envoyer vos enregistrements
Ce transcripteur transforme les paroles d'un fichier audio ou vidéo en texte brut grâce au modèle de reconnaissance vocale Whisper d'OpenAI. Contrairement à la plupart des services de transcription en ligne, il n'envoie votre fichier nulle part. Le modèle s'exécute dans votre navigateur via Transformers.js et ONNX Runtime, en utilisant votre carte graphique par WebGPU lorsqu'elle est disponible et en se rabattant sinon sur WebAssembly sur le processeur. Interviews, enregistrements de réunions, cours, mémos vocaux et vidéos privées restent sur votre appareil du début à la fin.
Le seul téléchargement réseau est le modèle lui-même. Lors de la première utilisation, l'outil récupère les poids de Whisper depuis le hub de modèles Hugging Face, que le navigateur met ensuite en cache, si bien que la transcription suivante démarre presque immédiatement. Aucune donnée de votre audio n'est incluse dans cette requête.
Comment fonctionne la transcription
Lorsque vous appuyez sur Transcribe, la piste audio est décodée et rééchantillonnée en 16 kHz mono, le format attendu par Whisper. Les longs enregistrements sont découpés en fenêtres de 30 secondes maximum, et chaque coupure est placée au moment le plus silencieux vers la fin de la fenêtre afin que les mots soient rarement coupés en deux. Les fenêtres silencieuses sont ignorées, car Whisper a tendance à inventer des phrases comme « Thank you » lorsqu'il n'entend rien. Chaque fenêtre est transcrite dans un worker en arrière-plan pour que la page reste réactive, et le texte s'affiche dès que chaque morceau est terminé.
Whisper Tiny est l'option la plus rapide et convient bien à une parole claire. Whisper Base est nettement plus précis avec les accents et les audios bruités, au prix d'un téléchargement plus volumineux et d'un traitement plus lent. Si vous connaissez la langue parlée, sélectionnez-la ; la détection automatique écoute le début de l'enregistrement et choisit la langue la plus probable. L'option Translate produit un texte en anglais à partir d'une parole dans une autre langue.
Conseils pour de meilleurs résultats
La vitesse dépend de votre matériel : avec WebGPU, quelques minutes d'audio prennent souvent bien moins d'une minute, tandis qu'un traitement uniquement sur le processeur peut approcher le temps réel. Les enregistrements avec un seul locuteur proche du micro donnent le meilleur texte. La musique de fond, les voix qui se chevauchent et une forte compression réduisent la précision. Le résultat ne comporte ni noms de locuteurs ni horodatages ; si vous avez besoin de sous-titres minutés, utilisez plutôt le générateur automatique de sous-titres. Relisez toujours les noms, les chiffres et le vocabulaire spécialisé avant de publier ou de citer la transcription. Les fichiers très longs demandent beaucoup de mémoire ; si un onglet manque de mémoire, découpez d'abord l'enregistrement en parties plus courtes.
Comment utiliser
- Ajoutez un fichierDéposez dans la zone un enregistrement audio ou une vidéo contenant de la parole.
- Choisissez le modèle et la langueChoisissez Tiny pour la vitesse ou Base pour la précision, puis indiquez la langue parlée ou laissez Auto-detect.
- TranscrivezAppuyez sur Transcribe et regardez le texte apparaître fenêtre après fenêtre pendant que le modèle travaille.
- Copiez ou téléchargezRelisez la transcription, puis copiez-la ou enregistrez-la sous forme de fichier .txt.