MT Media Tools

Transkrypcja audio na tekst online — prywatny Whisper AI

Zamieniaj mowę z plików audio i wideo na tekst dzięki Whisper AI działającemu w przeglądarce. Bez przesyłania, za darmo, z kopiowaniem i pobieraniem TXT.

🔒 Działa całkowicie w Twojej przeglądarce — nic nie jest przesyłane

Drop an audio or video file here or click to browse

No file selected.

Advertisement

Mowa na tekst bez przesyłania nagrań

To narzędzie do transkrypcji zamienia wypowiedziane słowa z pliku audio lub wideo na zwykły tekst przy użyciu modelu rozpoznawania mowy Whisper od OpenAI. W przeciwieństwie do większości internetowych usług transkrypcji nie wysyła Twojego pliku nigdzie. Model działa w Twojej przeglądarce za pośrednictwem Transformers.js i ONNX Runtime, wykorzystując kartę graficzną przez WebGPU, gdy jest dostępne, a w przeciwnym razie korzystając z WebAssembly na procesorze. Wywiady, nagrania spotkań, wykłady, notatki głosowe i prywatne filmy przez cały czas pozostają na Twoim urządzeniu.

Jedynym pobieraniem z sieci jest sam model. Przy pierwszym uruchomieniu narzędzie pobiera wagi Whisper z hubu modeli Hugging Face, które przeglądarka następnie zapisuje w pamięci podręcznej, dzięki czemu kolejna transkrypcja rozpoczyna się niemal natychmiast. To żądanie nie zawiera żadnych danych z Twojego nagrania.

Jak działa transkrypcja

Po naciśnięciu Transcribe ścieżka dźwiękowa jest dekodowana i przepróbkowywana do 16 kHz mono, czyli formatu, którego oczekuje Whisper. Długie nagrania są dzielone na okna o długości do 30 sekund, a każde cięcie umieszczane jest w najcichszym momencie blisko końca okna, dzięki czemu słowa rzadko są przecinane w połowie. Ciche okna są pomijane, ponieważ Whisper ma tendencję do wymyślania fraz takich jak „Thank you”, gdy nic nie słyszy. Każde okno jest transkrybowane w workerze działającym w tle, więc strona pozostaje responsywna, a tekst pojawia się, gdy tylko każdy fragment zostanie ukończony.

Whisper Tiny to najszybsza opcja, która dobrze sprawdza się przy wyraźnej mowie. Whisper Base jest zauważalnie dokładniejszy przy akcentach i zaszumionym dźwięku, kosztem większego pobierania i wolniejszego przetwarzania. Jeśli znasz język wypowiedzi, wybierz go; automatyczne wykrywanie słucha początkowej części nagrania i wybiera najbardziej prawdopodobny język. Opcja Translate tworzy tekst w języku angielskim z mowy w innym języku.

Wskazówki dla lepszych wyników

Szybkość zależy od Twojego sprzętu: z WebGPU kilka minut nagrania zajmuje często znacznie mniej niż minutę, natomiast przetwarzanie wyłącznie na procesorze może trwać niemal tyle, ile samo nagranie. Najlepszy tekst dają nagrania z jednym mówcą blisko mikrofonu. Muzyka w tle, nakładające się głosy i silna kompresja obniżają dokładność. Wynik nie zawiera oznaczeń mówców ani znaczników czasu, więc jeśli potrzebujesz napisów z synchronizacją, użyj zamiast tego automatycznego generatora napisów. Zawsze sprawdzaj nazwy, liczby i słownictwo specjalistyczne przed opublikowaniem lub cytowaniem transkrypcji. Bardzo długie pliki wymagają dużo pamięci; jeśli w karcie zabraknie pamięci, najpierw podziel nagranie na krótsze części.

Jak używać

  1. Dodaj plikUpuść w polu nagranie audio lub film zawierający mowę.
  2. Wybierz model i językWybierz Tiny, jeśli liczy się szybkość, lub Base, jeśli liczy się dokładność, a następnie ustaw język wypowiedzi lub pozostaw Auto-detect.
  3. TranskrybujNaciśnij Transcribe i obserwuj, jak tekst pojawia się okno po oknie w trakcie pracy modelu.
  4. Skopiuj lub pobierzSprawdź transkrypcję, a następnie skopiuj ją lub zapisz jako plik .txt.

Najczęściej zadawane pytania

Czy moje nagranie jest przesyłane na serwer?
Nie. Twoje audio lub wideo jest dekodowane i transkrybowane na Twoim własnym urządzeniu. Pobierany jest wyłącznie sam model Whisper, który pochodzi z hubu modeli Hugging Face i jest zapisywany w pamięci podręcznej przeglądarki.
Dlaczego pierwsza transkrypcja jest wolniejsza?
Pierwsze uruchomienie pobiera model rozpoznawania mowy (około 40–130 MB w zależności od wybranego modelu) oraz ONNX Runtime. Później są one przechowywane w pamięci podręcznej, więc kolejne uruchomienia startują znacznie szybciej.
Jakie języki są obsługiwane?
Whisper rozumie około 100 języków. Wybierz język wypowiedzi, aby uzyskać najlepszą dokładność, lub użyj Auto-detect. Możesz też tłumaczyć mowę z innych języków na tekst w języku angielskim.
Jak dokładna jest transkrypcja?
Wyraźna mowa z niewielkim szumem w tle jest transkrybowana dobrze, zwłaszcza z modelem Base. Akcenty, muzyka, nakładające się wypowiedzi i terminy techniczne mogą powodować błędy, dlatego zawsze sprawdzaj tekst.
Czy działa z plikami wideo?
Tak. Obsługiwane są MP4, WebM, MOV, MKV i większość formatów audio. Ścieżka dźwiękowa jest wyodrębniana w przeglądarce, a ffmpeg.wasm służy jako rozwiązanie zapasowe dla formatów, których przeglądarka nie potrafi sama zdekodować.
Advertisement