MT Media Tools

Транскрипция аудио в текст онлайн — приватный Whisper AI

Преобразуйте речь из аудио- и видеофайлов в текст с помощью Whisper AI, работающего в вашем браузере. Без загрузки на сервер, бесплатно, с копированием и скачиванием в TXT.

🔒 Работает полностью в вашем браузере — ничего не загружается

Drop an audio or video file here or click to browse

No file selected.

Advertisement

Речь в текст без загрузки ваших записей

Этот транскрибатор превращает произнесённые слова в аудио- или видеофайле в обычный текст с помощью модели распознавания речи Whisper от OpenAI. В отличие от большинства онлайн-сервисов транскрипции, он никуда не отправляет ваш файл. Модель работает прямо в вашем браузере через Transformers.js и ONNX Runtime, используя видеокарту через WebGPU, когда она доступна, а в противном случае переключаясь на WebAssembly на процессоре. Интервью, записи совещаний, лекции, голосовые заметки и личные видео всё время остаются на вашем устройстве.

Единственное, что загружается из сети, — это сама модель. При первом запуске инструмент получает веса Whisper из хаба моделей Hugging Face, которые браузер затем кэширует, поэтому следующая транскрипция начинается почти сразу. Никаких данных вашего аудио в этом запросе нет.

Как работает транскрипция

Когда вы нажимаете Transcribe, звуковая дорожка декодируется и передискретизируется в 16 кГц моно — формат, который ожидает Whisper. Длинные записи разбиваются на окна длительностью до 30 секунд, и каждый разрез ставится в самый тихий момент ближе к концу окна, поэтому слова редко разрезаются пополам. Тихие окна пропускаются, поскольку Whisper склонен выдумывать фразы вроде «Thank you», когда ничего не слышит. Каждое окно транскрибируется в фоновом worker, так что страница остаётся отзывчивой, а текст появляется сразу, как только готов очередной фрагмент.

Whisper Tiny — самый быстрый вариант, который хорошо справляется с чёткой речью. Whisper Base заметно точнее при акцентах и зашумлённом аудио, но требует более объёмной загрузки и работает медленнее. Если вы знаете язык речи, выберите его; автоопределение прослушивает начало записи и выбирает наиболее вероятный язык. Опция Translate создаёт английский текст из речи на другом языке.

Советы для лучших результатов

Скорость зависит от вашего оборудования: с WebGPU несколько минут аудио часто обрабатываются значительно быстрее чем за минуту, тогда как обработка только на процессоре может занимать почти столько же времени, сколько длится запись. Лучший текст дают записи с одним говорящим рядом с микрофоном. Фоновая музыка, одновременная речь нескольких людей и сильное сжатие снижают точность. Результат не содержит пометок говорящих и временных меток, поэтому если вам нужны субтитры с таймингом, воспользуйтесь вместо этого автоматическим генератором субтитров. Всегда проверяйте имена, числа и специальную терминологию, прежде чем публиковать или цитировать расшифровку. Очень длинные файлы требуют много памяти; если вкладке не хватает памяти, сначала разделите запись на более короткие части.

Как использовать

  1. Добавьте файлПеретащите в поле аудиозапись или видео с речью.
  2. Выберите модель и языкВыберите Tiny для скорости или Base для точности, а также укажите язык речи или оставьте Auto-detect.
  3. ТранскрибируйтеНажмите Transcribe и наблюдайте, как текст появляется окно за окном по мере работы модели.
  4. Скопируйте или скачайтеПроверьте расшифровку, затем скопируйте её или сохраните как файл .txt.

Часто задаваемые вопросы

Загружается ли моё аудио на сервер?
Нет. Ваше аудио или видео декодируется и транскрибируется на вашем собственном устройстве. Скачивается только сама модель Whisper, которая поступает из хаба моделей Hugging Face и кэшируется вашим браузером.
Почему первая транскрипция медленнее?
При первом запуске скачиваются модель распознавания речи (примерно 40–130 МБ в зависимости от выбранной модели) и ONNX Runtime. После этого они кэшируются, поэтому последующие запуски стартуют гораздо быстрее.
Какие языки поддерживаются?
Whisper понимает около 100 языков. Выберите язык речи для наилучшей точности или используйте Auto-detect. Также можно переводить речь с других языков в английский текст.
Насколько точна транскрипция?
Чёткая речь с небольшим фоновым шумом транскрибируется хорошо, особенно с моделью Base. Акценты, музыка, одновременная речь нескольких говорящих и технические термины могут вызывать ошибки, поэтому всегда вычитывайте текст.
Работает ли инструмент с видеофайлами?
Да. Поддерживаются MP4, WebM, MOV, MKV и большинство аудиоформатов. Звуковая дорожка извлекается в браузере, а ffmpeg.wasm служит запасным вариантом для форматов, которые браузер не может декодировать самостоятельно.
Advertisement