Транскрипція аудіо в текст онлайн — приватний Whisper AI
Перетворюйте мовлення з аудіо- та відеофайлів на текст за допомогою Whisper AI, що працює у вашому браузері. Без завантаження на сервер, безкоштовно, з копіюванням і збереженням у TXT.
🔒 Працює повністю у вашому браузері — нічого не завантажуєтьсяМовлення в текст без завантаження ваших записів
Цей транскрибатор перетворює вимовлені слова в аудіо- чи відеофайлі на звичайний текст за допомогою моделі розпізнавання мовлення Whisper від OpenAI. На відміну від більшості онлайн-сервісів транскрипції, він нікуди не надсилає ваш файл. Модель працює прямо у вашому браузері через Transformers.js та ONNX Runtime, використовуючи відеокарту через WebGPU, коли вона доступна, а інакше переходячи на WebAssembly на процесорі. Інтерв’ю, записи нарад, лекції, голосові нотатки та приватні відео весь час залишаються на вашому пристрої.
Єдине, що завантажується з мережі, — це сама модель. Під час першого запуску інструмент отримує ваги Whisper із хабу моделей Hugging Face, які браузер потім кешує, тож наступна транскрипція починається майже миттєво. Жодних даних вашого аудіо цей запит не містить.
Як працює транскрипція
Коли ви натискаєте Transcribe, звукова доріжка декодується та передискретизується до 16 кГц моно — формату, який очікує Whisper. Довгі записи розбиваються на вікна тривалістю до 30 секунд, і кожен розріз розміщується в найтихішому моменті поблизу кінця вікна, тому слова рідко розрізаються навпіл. Тихі вікна пропускаються, оскільки Whisper схильний вигадувати фрази на кшталт «Thank you», коли нічого не чує. Кожне вікно транскрибується у фоновому worker, тож сторінка залишається чутливою, а текст з’являється одразу, щойно кожен фрагмент готовий.
Whisper Tiny — найшвидший варіант, який добре працює з чітким мовленням. Whisper Base помітно точніший з акцентами та зашумленим аудіо, але потребує більшого завантаження й повільнішої обробки. Якщо ви знаєте мову мовлення, виберіть її; автовизначення прослуховує початкову частину запису та обирає найімовірнішу мову. Опція Translate створює англійський текст із мовлення іншою мовою.
Поради для кращих результатів
Швидкість залежить від вашого обладнання: з WebGPU кілька хвилин аудіо часто обробляються значно швидше ніж за хвилину, тоді як обробка лише на процесорі може тривати майже стільки ж, скільки сам запис. Найкращий текст дають записи з одним мовцем поблизу мікрофона. Фонова музика, одночасне мовлення кількох людей і сильне стиснення знижують точність. Результат не містить позначок мовців чи часових міток, тож якщо вам потрібні субтитри з таймінгом, скористайтеся натомість автоматичним генератором субтитрів. Завжди перевіряйте імена, числа та спеціальну термінологію, перш ніж публікувати чи цитувати транскрипт. Дуже довгі файли потребують багато пам’яті; якщо вкладці бракує пам’яті, спершу розділіть запис на коротші частини.
Як користуватися
- Додайте файлПеретягніть у поле аудіозапис або відео з мовленням.
- Виберіть модель і мовуВиберіть Tiny для швидкості або Base для точності, а також укажіть мову мовлення чи залиште Auto-detect.
- ТранскрибуйтеНатисніть Transcribe і спостерігайте, як текст з’являється вікно за вікном, поки працює модель.
- Скопіюйте або завантажтеПеревірте транскрипт, а потім скопіюйте його або збережіть як файл .txt.