MT Media Tools

Transkribera ljud till text online — privat Whisper AI

Omvandla tal i ljud- och videofiler till text med Whisper AI som körs i din webbläsare. Inga uppladdningar, gratis, med kopiering och TXT-nedladdning.

🔒 Körs helt i din webbläsare — ingenting laddas upp

Drop an audio or video file here or click to browse

No file selected.

Advertisement

Tal till text utan att ladda upp dina inspelningar

Den här transkriberingen omvandlar talade ord i en ljud- eller videofil till ren text med hjälp av OpenAI:s taligenkänningsmodell Whisper. Till skillnad från de flesta transkriberingstjänster på nätet skickar den inte din fil någonstans. Modellen körs i din webbläsare via Transformers.js och ONNX Runtime, använder ditt grafikkort via WebGPU när det finns tillgängligt och faller annars tillbaka på WebAssembly på processorn. Intervjuer, mötesinspelningar, föreläsningar, röstmemon och privata videor stannar på din enhet hela tiden.

Den enda nedladdningen över nätverket är själva modellen. Första gången hämtar verktyget Whisper-vikterna från Hugging Face-modellhubben, som webbläsaren sedan cachar, så att nästa transkribering startar nästan direkt. Ingenting från ditt ljud ingår i den förfrågan.

Så fungerar transkriberingen

När du trycker på Transcribe avkodas ljudspåret och samplas om till 16 kHz mono, formatet som Whisper förväntar sig. Långa inspelningar delas upp i fönster på upp till 30 sekunder, och varje klipp placeras vid det tystaste ögonblicket nära slutet av fönstret så att ord sällan delas mitt itu. Tysta fönster hoppas över eftersom Whisper tenderar att hitta på fraser som ”Thank you” när den inte hör något. Varje fönster transkriberas i en bakgrundsworker så att sidan förblir responsiv, och texten visas så snart varje del är klar.

Whisper Tiny är det snabbaste alternativet och fungerar bra för tydligt tal. Whisper Base är märkbart mer exakt med brytningar och brusigt ljud, till priset av en större nedladdning och långsammare bearbetning. Om du vet vilket språk som talas, välj det; automatisk identifiering lyssnar på början av inspelningen och väljer det mest sannolika språket. Alternativet Translate skapar engelsk text från tal på ett annat språk.

Tips för bättre resultat

Hastigheten beror på din hårdvara: med WebGPU tar några minuters ljud ofta klart under en minut, medan bearbetning enbart på processorn kan ta nästan realtid. Inspelningar med en talare nära mikrofonen ger bäst text. Bakgrundsmusik, personer som pratar i mun på varandra och kraftig komprimering minskar precisionen. Resultatet saknar talaretiketter och tidsstämplar, så om du behöver undertexter med tidskoder bör du i stället använda den automatiska undertextgeneratorn. Korrekturläs alltid namn, siffror och fackord innan du publicerar eller citerar transkriptionen. Mycket långa filer kräver mycket minne; om en flik får slut på minne, dela först upp inspelningen i kortare delar.

Hur man använder

  1. Lägg till en filSläpp en ljudinspelning eller en video med tal i rutan.
  2. Välj modell och språkVälj Tiny för hastighet eller Base för precision, och ange det talade språket eller låt Auto-detect vara kvar.
  3. TranskriberaTryck på Transcribe och se texten dyka upp fönster för fönster medan modellen arbetar.
  4. Kopiera eller ladda nerKorrekturläs transkriptionen och kopiera den sedan eller spara den som en .txt-fil.

Vanliga frågor

Laddas mitt ljud upp till en server?
Nej. Ditt ljud eller din video avkodas och transkriberas på din egen enhet. Det enda som laddas ner är själva Whisper-modellen, som kommer från Hugging Face-modellhubben och cachas av din webbläsare.
Varför är den första transkriberingen långsammare?
Första körningen laddar ner taligenkänningsmodellen (ungefär 40–130 MB beroende på vilken modell du väljer) och ONNX Runtime. Därefter är de cachade, så senare körningar startar mycket snabbare.
Vilka språk stöds?
Whisper förstår omkring 100 språk. Välj det talade språket för bäst precision eller använd Auto-detect. Du kan också översätta tal från andra språk till engelsk text.
Hur exakt är den?
Tydligt tal med lite bakgrundsbrus transkriberas bra, särskilt med Base-modellen. Brytningar, musik, talare som överlappar varandra och tekniska termer kan orsaka fel, så korrekturläs alltid texten.
Fungerar det med videofiler?
Ja. MP4, WebM, MOV, MKV och de flesta ljudformat fungerar. Ljudspåret extraheras i webbläsaren, med ffmpeg.wasm som reserv för format som webbläsaren inte kan avkoda själv.
Advertisement