Whisper

Transcribe audio a texto con alta precisión, open source.

VozGratisIntermedio

Para qué sirve

Es un modelo de inteligencia artificial de código abierto creado por OpenAI que transcribe audio a texto (speech-to-text) con muy buena precisión en decenas de idiomas, y también puede traducir el audio directamente a texto en inglés.

Usos concretos

  • Transcribir entrevistas, podcasts, clases o reuniones grabadas a texto de forma automática.
  • Generar subtítulos para videos en el idioma original o traducidos al inglés.
  • Integrarlo en tus propias apps o flujos de trabajo de forma local, sin depender de un servicio en la nube.
  • Procesar grandes volúmenes de audio de forma gratuita al correrlo en tu propio hardware.
  • Usarlo como base para construir asistentes de voz o herramientas de accesibilidad.

Ejemplo práctico

Un creador de contenido graba un pódcast de una hora y, en vez de transcribirlo a mano, corre el archivo de audio a través de Whisper en su computadora y obtiene el texto completo en pocos minutos, listo para convertir en un artículo de blog.

Datos del recurso

Modalidad de costo
Gratis — 100% gratuito y de código abierto (licencia MIT); no tiene planes de pago porque no es un servicio, sino un modelo que se instala y corre en tu propia computadora o servidor (o vía la API de pago de OpenAI si prefieres no instalarlo).
Nivel
Intermedio
Países disponibles
Disponible en todo el mundo (uso local, sin restricción geográfica)
Requisitos
Conocimientos básicos de programación (Python) para instalarlo y correrlo; o usar la API de OpenAI como alternativa sin instalación.
API e integraciones
OpenAI también ofrece Whisper como parte de su API de pago (platform.openai.com) para quienes prefieren no instalarlo localmente.
Última revisión
14 de septiembre de 2026