Whisper
Transcribe audio a texto con alta precisión, open source.
Para qué sirve
Es un modelo de inteligencia artificial de código abierto creado por OpenAI que transcribe audio a texto (speech-to-text) con muy buena precisión en decenas de idiomas, y también puede traducir el audio directamente a texto en inglés.
Usos concretos
- Transcribir entrevistas, podcasts, clases o reuniones grabadas a texto de forma automática.
- Generar subtítulos para videos en el idioma original o traducidos al inglés.
- Integrarlo en tus propias apps o flujos de trabajo de forma local, sin depender de un servicio en la nube.
- Procesar grandes volúmenes de audio de forma gratuita al correrlo en tu propio hardware.
- Usarlo como base para construir asistentes de voz o herramientas de accesibilidad.
Ejemplo práctico
Un creador de contenido graba un pódcast de una hora y, en vez de transcribirlo a mano, corre el archivo de audio a través de Whisper en su computadora y obtiene el texto completo en pocos minutos, listo para convertir en un artículo de blog.
Datos del recurso
- Modalidad de costo
- Gratis — 100% gratuito y de código abierto (licencia MIT); no tiene planes de pago porque no es un servicio, sino un modelo que se instala y corre en tu propia computadora o servidor (o vía la API de pago de OpenAI si prefieres no instalarlo).
- Nivel
- Intermedio
- Países disponibles
- Disponible en todo el mundo (uso local, sin restricción geográfica)
- Requisitos
- Conocimientos básicos de programación (Python) para instalarlo y correrlo; o usar la API de OpenAI como alternativa sin instalación.
- API e integraciones
- OpenAI también ofrece Whisper como parte de su API de pago (platform.openai.com) para quienes prefieren no instalarlo localmente.
- Última revisión
- 14 de septiembre de 2026
