MT Media Tools

Transcrire un audio en texte en ligne — Whisper AI privé

Convertissez la parole de fichiers audio et vidéo en texte avec Whisper AI exécuté dans votre navigateur. Sans envoi, gratuit, avec copie et téléchargement TXT.

🔒 S'exécute entièrement dans votre navigateur — rien n'est téléchargé

Drop an audio or video file here or click to browse

No file selected.

Advertisement

De la parole au texte sans envoyer vos enregistrements

Ce transcripteur transforme les paroles d'un fichier audio ou vidéo en texte brut grâce au modèle de reconnaissance vocale Whisper d'OpenAI. Contrairement à la plupart des services de transcription en ligne, il n'envoie votre fichier nulle part. Le modèle s'exécute dans votre navigateur via Transformers.js et ONNX Runtime, en utilisant votre carte graphique par WebGPU lorsqu'elle est disponible et en se rabattant sinon sur WebAssembly sur le processeur. Interviews, enregistrements de réunions, cours, mémos vocaux et vidéos privées restent sur votre appareil du début à la fin.

Le seul téléchargement réseau est le modèle lui-même. Lors de la première utilisation, l'outil récupère les poids de Whisper depuis le hub de modèles Hugging Face, que le navigateur met ensuite en cache, si bien que la transcription suivante démarre presque immédiatement. Aucune donnée de votre audio n'est incluse dans cette requête.

Comment fonctionne la transcription

Lorsque vous appuyez sur Transcribe, la piste audio est décodée et rééchantillonnée en 16 kHz mono, le format attendu par Whisper. Les longs enregistrements sont découpés en fenêtres de 30 secondes maximum, et chaque coupure est placée au moment le plus silencieux vers la fin de la fenêtre afin que les mots soient rarement coupés en deux. Les fenêtres silencieuses sont ignorées, car Whisper a tendance à inventer des phrases comme « Thank you » lorsqu'il n'entend rien. Chaque fenêtre est transcrite dans un worker en arrière-plan pour que la page reste réactive, et le texte s'affiche dès que chaque morceau est terminé.

Whisper Tiny est l'option la plus rapide et convient bien à une parole claire. Whisper Base est nettement plus précis avec les accents et les audios bruités, au prix d'un téléchargement plus volumineux et d'un traitement plus lent. Si vous connaissez la langue parlée, sélectionnez-la ; la détection automatique écoute le début de l'enregistrement et choisit la langue la plus probable. L'option Translate produit un texte en anglais à partir d'une parole dans une autre langue.

Conseils pour de meilleurs résultats

La vitesse dépend de votre matériel : avec WebGPU, quelques minutes d'audio prennent souvent bien moins d'une minute, tandis qu'un traitement uniquement sur le processeur peut approcher le temps réel. Les enregistrements avec un seul locuteur proche du micro donnent le meilleur texte. La musique de fond, les voix qui se chevauchent et une forte compression réduisent la précision. Le résultat ne comporte ni noms de locuteurs ni horodatages ; si vous avez besoin de sous-titres minutés, utilisez plutôt le générateur automatique de sous-titres. Relisez toujours les noms, les chiffres et le vocabulaire spécialisé avant de publier ou de citer la transcription. Les fichiers très longs demandent beaucoup de mémoire ; si un onglet manque de mémoire, découpez d'abord l'enregistrement en parties plus courtes.

Comment utiliser

  1. Ajoutez un fichierDéposez dans la zone un enregistrement audio ou une vidéo contenant de la parole.
  2. Choisissez le modèle et la langueChoisissez Tiny pour la vitesse ou Base pour la précision, puis indiquez la langue parlée ou laissez Auto-detect.
  3. TranscrivezAppuyez sur Transcribe et regardez le texte apparaître fenêtre après fenêtre pendant que le modèle travaille.
  4. Copiez ou téléchargezRelisez la transcription, puis copiez-la ou enregistrez-la sous forme de fichier .txt.

Questions fréquemment posées

Mon audio est-il envoyé sur un serveur ?
Non. Votre audio ou votre vidéo est décodé et transcrit sur votre propre appareil. La seule chose téléchargée est le modèle Whisper lui-même, qui provient du hub de modèles Hugging Face et est mis en cache par votre navigateur.
Pourquoi la première transcription est-elle plus lente ?
La première exécution télécharge le modèle de reconnaissance vocale (environ 40–130 Mo selon le modèle choisi) ainsi que ONNX Runtime. Ils sont ensuite mis en cache, de sorte que les exécutions suivantes démarrent beaucoup plus vite.
Quelles langues sont prises en charge ?
Whisper comprend environ 100 langues. Choisissez la langue parlée pour une précision optimale ou utilisez Auto-detect. Vous pouvez aussi traduire une parole dans une autre langue en texte anglais.
Quelle est la précision ?
Une parole claire avec peu de bruit de fond est bien transcrite, surtout avec le modèle Base. Les accents, la musique, les locuteurs qui se chevauchent et les termes techniques peuvent provoquer des erreurs, relisez donc toujours le texte.
Est-ce que cela fonctionne avec des fichiers vidéo ?
Oui. MP4, WebM, MOV, MKV et la plupart des formats audio fonctionnent. La piste audio est extraite dans le navigateur, avec ffmpeg.wasm comme solution de repli pour les formats que le navigateur ne sait pas décoder lui-même.
Advertisement