MT Media Tools

Trascrivere audio in testo online — Whisper AI privato

Converti il parlato di file audio e video in testo con Whisper AI eseguito nel browser. Nessun caricamento, gratis, con copia e download in TXT.

🔒 Funziona interamente nel tuo browser — nulla viene caricato

Drop an audio or video file here or click to browse

No file selected.

Advertisement

Da voce a testo senza caricare le tue registrazioni

Questo trascrittore trasforma le parole pronunciate in un file audio o video in testo semplice utilizzando il modello di riconoscimento vocale Whisper di OpenAI. A differenza della maggior parte dei servizi di trascrizione online, non invia il tuo file da nessuna parte. Il modello viene eseguito all'interno del browser tramite Transformers.js e ONNX Runtime, sfruttando la scheda grafica tramite WebGPU quando è disponibile e ricorrendo altrimenti a WebAssembly sulla CPU. Interviste, registrazioni di riunioni, lezioni, memo vocali e video privati restano sempre sul tuo dispositivo.

L'unico download dalla rete è il modello stesso. Al primo avvio lo strumento scarica i pesi di Whisper dall'hub dei modelli di Hugging Face, che il browser poi memorizza nella cache, così la trascrizione successiva parte quasi subito. Nessun dato del tuo audio è incluso in quella richiesta.

Come funziona la trascrizione

Quando premi Transcribe, la traccia audio viene decodificata e ricampionata a 16 kHz mono, il formato che Whisper si aspetta. Le registrazioni lunghe vengono suddivise in finestre di massimo 30 secondi, e ogni taglio viene posizionato nel momento più silenzioso vicino alla fine della finestra, così le parole vengono spezzate a metà solo raramente. Le finestre silenziose vengono saltate perché Whisper tende a inventare frasi come «Thank you» quando non sente nulla. Ogni finestra viene trascritta in un worker in background, così la pagina resta reattiva, e il testo compare non appena ciascun pezzo è pronto.

Whisper Tiny è l'opzione più veloce e funziona bene con un parlato chiaro. Whisper Base è sensibilmente più preciso con accenti e audio rumoroso, al prezzo di un download più grande e di un'elaborazione più lenta. Se conosci la lingua parlata, selezionala; il rilevamento automatico ascolta la prima parte della registrazione e sceglie la lingua più probabile. L'opzione Translate produce testo in inglese a partire dal parlato in un'altra lingua.

Consigli per risultati migliori

La velocità dipende dal tuo hardware: con WebGPU pochi minuti di audio richiedono spesso ben meno di un minuto, mentre l'elaborazione solo su CPU può avvicinarsi al tempo reale. Le registrazioni con un solo parlante vicino al microfono danno il testo migliore. Musica di sottofondo, voci sovrapposte e una forte compressione riducono la precisione. Il risultato non contiene etichette dei parlanti né timestamp, quindi se ti servono sottotitoli con i tempi usa invece il generatore automatico di sottotitoli. Rileggi sempre nomi, numeri e termini specialistici prima di pubblicare o citare la trascrizione. I file molto lunghi richiedono molta memoria; se una scheda esaurisce la memoria, dividi prima la registrazione in parti più brevi.

Come usare

  1. Aggiungi un fileTrascina nel riquadro una registrazione audio o un video con del parlato.
  2. Scegli modello e linguaScegli Tiny per la velocità o Base per la precisione, e imposta la lingua parlata oppure lascia Auto-detect.
  3. TrascriviPremi Transcribe e guarda il testo comparire finestra dopo finestra mentre il modello lavora.
  4. Copia o scaricaRileggi la trascrizione, poi copiala o salvala come file .txt.

Domande frequenti

Il mio audio viene caricato su un server?
No. Il tuo audio o video viene decodificato e trascritto sul tuo dispositivo. L'unica cosa scaricata è il modello Whisper stesso, che proviene dall'hub dei modelli di Hugging Face e viene memorizzato nella cache dal browser.
Perché la prima trascrizione è più lenta?
Il primo avvio scarica il modello di riconoscimento vocale (circa 40–130 MB a seconda del modello scelto) e ONNX Runtime. In seguito vengono memorizzati nella cache, quindi le esecuzioni successive partono molto più velocemente.
Quali lingue sono supportate?
Whisper comprende circa 100 lingue. Scegli la lingua parlata per la massima precisione oppure usa Auto-detect. Puoi anche tradurre il parlato da altre lingue in testo inglese.
Quanto è preciso?
Il parlato chiaro con poco rumore di fondo viene trascritto bene, soprattutto con il modello Base. Accenti, musica, parlanti sovrapposti e termini tecnici possono causare errori, quindi rileggi sempre il testo.
Funziona con i file video?
Sì. MP4, WebM, MOV, MKV e la maggior parte dei formati audio funzionano. La traccia audio viene estratta nel browser, con ffmpeg.wasm come alternativa per i formati che il browser non riesce a decodificare da solo.
Advertisement