Transcribir audio a texto online — Whisper AI privado
Convierte la voz de archivos de audio y vídeo en texto con Whisper AI ejecutándose en tu navegador. Sin subidas, gratis, con copia y descarga en TXT.
🔒 Se ejecuta completamente en tu navegador — nada se cargaDe voz a texto sin subir tus grabaciones
Este transcriptor convierte las palabras habladas de un archivo de audio o vídeo en texto plano utilizando el modelo de reconocimiento de voz Whisper de OpenAI. A diferencia de la mayoría de los servicios de transcripción online, no envía tu archivo a ninguna parte. El modelo se ejecuta dentro de tu navegador mediante Transformers.js y ONNX Runtime, usando tu tarjeta gráfica a través de WebGPU cuando está disponible y recurriendo a WebAssembly en la CPU en caso contrario. Entrevistas, grabaciones de reuniones, clases, notas de voz y vídeos privados permanecen en tu dispositivo en todo momento.
La única descarga de red es el propio modelo. En la primera ejecución, la herramienta obtiene los pesos de Whisper del hub de modelos de Hugging Face, que el navegador guarda después en caché, de modo que la siguiente transcripción empieza casi de inmediato. Esa solicitud no incluye absolutamente nada de tu audio.
Cómo funciona la transcripción
Al pulsar Transcribe, la pista de audio se decodifica y se remuestrea a 16 kHz mono, el formato que espera Whisper. Las grabaciones largas se dividen en ventanas de hasta 30 segundos, y cada corte se sitúa en el momento más silencioso cerca del final de la ventana, para que las palabras rara vez queden partidas por la mitad. Las ventanas en silencio se omiten porque Whisper tiende a inventar frases como «Thank you» cuando no oye nada. Cada ventana se transcribe en un worker en segundo plano para que la página siga respondiendo, y el texto aparece en cuanto termina cada fragmento.
Whisper Tiny es la opción más rápida y funciona bien con voz clara. Whisper Base es notablemente más preciso con acentos y audio ruidoso, a costa de una descarga mayor y un procesamiento más lento. Si conoces el idioma hablado, selecciónalo; la detección automática escucha la primera parte de la grabación y elige el idioma más probable. La opción Translate genera texto en inglés a partir de voz en otro idioma.
Consejos para obtener mejores resultados
La velocidad depende de tu hardware: con WebGPU, unos minutos de audio suelen tardar bastante menos de un minuto, mientras que el procesamiento solo con CPU puede acercarse al tiempo real. Las grabaciones con un único hablante cerca del micrófono dan el mejor texto. La música de fondo, las voces superpuestas y una compresión fuerte reducen la precisión. El resultado no incluye etiquetas de hablante ni marcas de tiempo, así que si necesitas subtítulos con tiempos, usa en su lugar el generador automático de subtítulos. Revisa siempre nombres, números y vocabulario especializado antes de publicar o citar la transcripción. Los archivos muy largos necesitan mucha memoria; si una pestaña se queda sin memoria, divide primero la grabación en partes más cortas.
Cómo usar
- Añade un archivoArrastra al recuadro una grabación de audio o un vídeo con voz.
- Elige modelo e idiomaElige Tiny para mayor velocidad o Base para mayor precisión, y selecciona el idioma hablado o deja Auto-detect.
- TranscribePulsa Transcribe y observa cómo el texto aparece ventana a ventana mientras trabaja el modelo.
- Copia o descargaRevisa la transcripción y luego cópiala o guárdala como archivo .txt.