Automatyczny generator napisów — darmowe SRT i VTT z Whisper AI
Automatycznie generuj napisy z mowy za pomocą Whisper AI w przeglądarce. Edytuj napisy, podglądaj je i pobieraj pliki SRT lub VTT. Bez przesyłania plików.
🔒 Działa całkowicie w Twojej przeglądarce — nic nie jest przesyłaneAutomatyczne napisy, które pozostają na Twoim urządzeniu
Napisy sprawiają, że filmy są dostępne dla osób niesłyszących i niedosłyszących, pomagają widzom oglądającym bez dźwięku i poprawiają to, jak wyszukiwarki rozumieją Twoje treści. Ręczne ich pisanie jest czasochłonne, dlatego to narzędzie wsłuchuje się w mowę w Twoim filmie i automatycznie tworzy zsynchronizowane napisy. Korzysta z modelu rozpoznawania mowy Whisper ze znacznikami czasu, działającego lokalnie w przeglądarce dzięki Transformers.js, z akceleracją WebGPU, gdy urządzenie ją obsługuje, a w przeciwnym razie z WebAssembly.
Twój film nigdy nie jest przesyłany. Jedynym pobieraniem jest sam model z huba Hugging Face, który przeglądarka zapisuje w pamięci podręcznej po pierwszym uruchomieniu. Dzięki temu narzędzie nadaje się do nieopublikowanych nagrań, projektów dla klientów, wewnętrznych filmów szkoleniowych i wszystkiego, czego wolisz nie powierzać zewnętrznemu serwisowi do tworzenia napisów.
Od mowy do zsynchronizowanych napisów SRT i VTT
Ścieżka dźwiękowa jest dekodowana do mono 16 kHz i dzielona w cichych momentach na okna o długości do 30 sekund. Whisper zwraca dla każdego okna krótkie frazy z czasem rozpoczęcia i zakończenia, które są następnie przesuwane na właściwe miejsce w całym filmie. Frazy dłuższe niż wybrany limit znaków są dzielone na granicach słów z proporcjonalnym podziałem czasu, a długie wiersze są łamane na dwa wyważone wiersze dla wygodnego czytania. Limit 84 znaków, czyli około dwóch wierszy po 42, odpowiada powszechnym wytycznym telewizji i serwisów streamingowych.
Listę napisów można w pełni edytować. Zmieniaj czasy w formacie HH:MM:SS.mmm, poprawiaj źle rozpoznane słowa, usuwaj błędne napisy lub dodawaj nowe w bieżącym miejscu podglądu. Odtwarzacz podglądu wyświetla Twoje najnowsze zmiany jako napisy na żywo, więc możesz sprawdzić synchronizację przed eksportem. SRT to format najszerzej obsługiwany przez edytory i platformy do publikowania; VTT to natywny format odtwarzaczy wideo w przeglądarce.
Jak uzyskać dokładne napisy
Jeśli znasz język mówiony, wybierz go zamiast polegać na automatycznym wykrywaniu, a w przypadku wywiadów, akcentów lub zaszumionego dźwięku wybierz model Base. Fragmenty z dużą ilością muzyki i nakładające się głosy są najczęstszym źródłem błędów, a znaczniki czasu Whispera mogą przesuwać się o ułamek sekundy, dlatego szybki przegląd zawsze się opłaca. Aby wyświetlać napisy na stałe, na przykład w mediach społecznościowych, które nie obsługują plików z napisami, wczytaj gotowy plik SRT do narzędzia do wtapiania napisów.
Jak używać
- Dodaj filmUpuść plik wideo lub audio; pojawi się odtwarzacz podglądu, w którym sprawdzisz wynik.
- Wybierz opcjeWybierz model, język mówiony (lub automatyczne wykrywanie) oraz liczbę znaków, jaką może zawierać każdy napis.
- GenerujKliknij „Generate subtitles”, a napisy będą się pojawiać w miarę rozpoznawania kolejnych 30-sekundowych okien.
- Edytuj i eksportujPrzejrzyj napisy w podglądzie, popraw ewentualne błędy i pobierz plik .srt lub .vtt.