MT Media Tools

Транскрипція аудіо в текст онлайн — приватний Whisper AI

Перетворюйте мовлення з аудіо- та відеофайлів на текст за допомогою Whisper AI, що працює у вашому браузері. Без завантаження на сервер, безкоштовно, з копіюванням і збереженням у TXT.

🔒 Працює повністю у вашому браузері — нічого не завантажується

Drop an audio or video file here or click to browse

No file selected.

Advertisement

Мовлення в текст без завантаження ваших записів

Цей транскрибатор перетворює вимовлені слова в аудіо- чи відеофайлі на звичайний текст за допомогою моделі розпізнавання мовлення Whisper від OpenAI. На відміну від більшості онлайн-сервісів транскрипції, він нікуди не надсилає ваш файл. Модель працює прямо у вашому браузері через Transformers.js та ONNX Runtime, використовуючи відеокарту через WebGPU, коли вона доступна, а інакше переходячи на WebAssembly на процесорі. Інтерв’ю, записи нарад, лекції, голосові нотатки та приватні відео весь час залишаються на вашому пристрої.

Єдине, що завантажується з мережі, — це сама модель. Під час першого запуску інструмент отримує ваги Whisper із хабу моделей Hugging Face, які браузер потім кешує, тож наступна транскрипція починається майже миттєво. Жодних даних вашого аудіо цей запит не містить.

Як працює транскрипція

Коли ви натискаєте Transcribe, звукова доріжка декодується та передискретизується до 16 кГц моно — формату, який очікує Whisper. Довгі записи розбиваються на вікна тривалістю до 30 секунд, і кожен розріз розміщується в найтихішому моменті поблизу кінця вікна, тому слова рідко розрізаються навпіл. Тихі вікна пропускаються, оскільки Whisper схильний вигадувати фрази на кшталт «Thank you», коли нічого не чує. Кожне вікно транскрибується у фоновому worker, тож сторінка залишається чутливою, а текст з’являється одразу, щойно кожен фрагмент готовий.

Whisper Tiny — найшвидший варіант, який добре працює з чітким мовленням. Whisper Base помітно точніший з акцентами та зашумленим аудіо, але потребує більшого завантаження й повільнішої обробки. Якщо ви знаєте мову мовлення, виберіть її; автовизначення прослуховує початкову частину запису та обирає найімовірнішу мову. Опція Translate створює англійський текст із мовлення іншою мовою.

Поради для кращих результатів

Швидкість залежить від вашого обладнання: з WebGPU кілька хвилин аудіо часто обробляються значно швидше ніж за хвилину, тоді як обробка лише на процесорі може тривати майже стільки ж, скільки сам запис. Найкращий текст дають записи з одним мовцем поблизу мікрофона. Фонова музика, одночасне мовлення кількох людей і сильне стиснення знижують точність. Результат не містить позначок мовців чи часових міток, тож якщо вам потрібні субтитри з таймінгом, скористайтеся натомість автоматичним генератором субтитрів. Завжди перевіряйте імена, числа та спеціальну термінологію, перш ніж публікувати чи цитувати транскрипт. Дуже довгі файли потребують багато пам’яті; якщо вкладці бракує пам’яті, спершу розділіть запис на коротші частини.

Як користуватися

  1. Додайте файлПеретягніть у поле аудіозапис або відео з мовленням.
  2. Виберіть модель і мовуВиберіть Tiny для швидкості або Base для точності, а також укажіть мову мовлення чи залиште Auto-detect.
  3. ТранскрибуйтеНатисніть Transcribe і спостерігайте, як текст з’являється вікно за вікном, поки працює модель.
  4. Скопіюйте або завантажтеПеревірте транскрипт, а потім скопіюйте його або збережіть як файл .txt.

Часті запитання

Чи завантажується моє аудіо на сервер?
Ні. Ваше аудіо чи відео декодується й транскрибується на вашому власному пристрої. Завантажується лише сама модель Whisper, яка надходить із хабу моделей Hugging Face і кешується вашим браузером.
Чому перша транскрипція повільніша?
Під час першого запуску завантажуються модель розпізнавання мовлення (приблизно 40–130 МБ залежно від вибраної моделі) та ONNX Runtime. Після цього вони кешуються, тож наступні запуски стартують набагато швидше.
Які мови підтримуються?
Whisper розуміє близько 100 мов. Виберіть мову мовлення для найкращої точності або скористайтеся Auto-detect. Ви також можете перекладати мовлення з інших мов в англійський текст.
Наскільки точна транскрипція?
Чітке мовлення з невеликим фоновим шумом транскрибується добре, особливо з моделлю Base. Акценти, музика, одночасне мовлення кількох людей і технічні терміни можуть спричиняти помилки, тому завжди вичитуйте текст.
Чи працює інструмент із відеофайлами?
Так. Підтримуються MP4, WebM, MOV, MKV та більшість аудіоформатів. Звукова доріжка витягується в браузері, а ffmpeg.wasm слугує запасним варіантом для форматів, які браузер не може декодувати самостійно.
Advertisement