MT Media Tools

Transcrever áudio para texto online — Whisper AI privado

Converta a fala de arquivos de áudio e vídeo em texto com o Whisper AI rodando no seu navegador. Sem uploads, grátis, com cópia e download em TXT.

🔒 Executa completamente no seu navegador — nada é enviado

Drop an audio or video file here or click to browse

No file selected.

Advertisement

Da fala ao texto sem enviar suas gravações

Este transcritor transforma as palavras faladas de um arquivo de áudio ou vídeo em texto simples usando o modelo de reconhecimento de fala Whisper, da OpenAI. Ao contrário da maioria dos serviços de transcrição online, ele não envia seu arquivo para lugar nenhum. O modelo é executado dentro do seu navegador por meio do Transformers.js e do ONNX Runtime, usando sua placa de vídeo via WebGPU quando disponível e recorrendo ao WebAssembly na CPU caso contrário. Entrevistas, gravações de reuniões, aulas, notas de voz e vídeos privados permanecem no seu dispositivo o tempo todo.

O único download pela rede é o próprio modelo. Na primeira execução, a ferramenta busca os pesos do Whisper no hub de modelos do Hugging Face, que o navegador depois guarda em cache, para que a próxima transcrição comece quase imediatamente. Nada do seu áudio é incluído nessa solicitação.

Como funciona a transcrição

Quando você clica em Transcribe, a faixa de áudio é decodificada e reamostrada para 16 kHz mono, o formato que o Whisper espera. Gravações longas são divididas em janelas de até 30 segundos, e cada corte é posicionado no momento mais silencioso perto do fim da janela, para que as palavras raramente sejam cortadas ao meio. Janelas silenciosas são ignoradas porque o Whisper tende a inventar frases como «Thank you» quando não ouve nada. Cada janela é transcrita em um worker em segundo plano para que a página continue responsiva, e o texto aparece assim que cada trecho é concluído.

O Whisper Tiny é a opção mais rápida e funciona bem com fala clara. O Whisper Base é visivelmente mais preciso com sotaques e áudio ruidoso, ao custo de um download maior e de um processamento mais lento. Se você souber o idioma falado, selecione-o; a detecção automática escuta a primeira parte da gravação e escolhe o idioma mais provável. A opção Translate gera texto em inglês a partir de fala em outro idioma.

Dicas para melhores resultados

A velocidade depende do seu hardware: com WebGPU, alguns minutos de áudio costumam levar bem menos de um minuto, enquanto o processamento apenas na CPU pode se aproximar do tempo real. Gravações com um único locutor próximo ao microfone geram o melhor texto. Música de fundo, vozes sobrepostas e compressão forte reduzem a precisão. O resultado não tem identificação de locutores nem marcações de tempo; se você precisa de legendas com tempos, use o gerador automático de legendas. Revise sempre nomes, números e vocabulário especializado antes de publicar ou citar a transcrição. Arquivos muito longos exigem bastante memória; se uma aba ficar sem memória, divida primeiro a gravação em partes menores.

Como usar

  1. Adicione um arquivoArraste para a caixa uma gravação de áudio ou um vídeo com fala.
  2. Escolha modelo e idiomaEscolha Tiny para velocidade ou Base para precisão, e defina o idioma falado ou deixe Auto-detect.
  3. TranscrevaClique em Transcribe e veja o texto aparecer janela por janela enquanto o modelo trabalha.
  4. Copie ou baixeRevise a transcrição e depois copie-a ou salve-a como arquivo .txt.

Perguntas frequentes

Meu áudio é enviado para um servidor?
Não. Seu áudio ou vídeo é decodificado e transcrito no seu próprio dispositivo. A única coisa baixada é o próprio modelo Whisper, que vem do hub de modelos do Hugging Face e fica em cache no seu navegador.
Por que a primeira transcrição é mais lenta?
A primeira execução baixa o modelo de reconhecimento de fala (cerca de 40–130 MB, dependendo do modelo escolhido) e o ONNX Runtime. Depois disso eles ficam em cache, então as execuções seguintes começam muito mais rápido.
Quais idiomas são suportados?
O Whisper entende cerca de 100 idiomas. Escolha o idioma falado para obter a melhor precisão ou use Auto-detect. Você também pode traduzir fala de outros idiomas para texto em inglês.
Qual é a precisão?
Fala clara com pouco ruído de fundo é bem transcrita, principalmente com o modelo Base. Sotaques, música, locutores sobrepostos e termos técnicos podem causar erros, por isso revise sempre o texto.
Funciona com arquivos de vídeo?
Sim. MP4, WebM, MOV, MKV e a maioria dos formatos de áudio funcionam. A faixa de áudio é extraída no navegador, com o ffmpeg.wasm como alternativa para formatos que o navegador não consegue decodificar sozinho.
Advertisement