
Whisper (OpenAI)
OpenAI · Voz · desde 2022
Modelo de reconocimiento de voz de OpenAI, abierto (licencia MIT) y multilingüe; para transcribir audio en local o vía API a bajo coste.
Qué es Whisper (OpenAI)
Whisper es el modelo de transcripción que OpenAI publicó en 2022 con código y pesos bajo licencia MIT. Reconoce 98 idiomas, traduce al inglés y genera marcas de tiempo, y puede ejecutarse en un servidor propio en varios tamaños (tiny, base, small, medium, large y turbo).
En la API de OpenAI sigue disponible como whisper-1 (0,006 $ por minuto), pero ya convive con modelos más nuevos: gpt-transcribe (0,0045 $/min, el recomendado para grabaciones), gpt-4o-transcribe y gpt-4o-mini-transcribe, gpt-4o-transcribe-diarize (identifica hablantes) y gpt-live-transcribe para audio en directo (0,017 $/min).
Es la base de decenas de productos de subtitulado y notas de reunión. Tiene sentido para desarrolladores y equipos técnicos que quieren transcripción barata integrada en sus flujos o que necesitan procesar audio sin sacarlo de su infraestructura.
Para qué sirve de verdad
- Transcribir y subtitular vídeos y podcasts en español de forma automática dentro de un flujo de n8n o Make
- Procesar grabaciones sensibles en un servidor propio sin enviar el audio a terceros
- Convertir notas de voz y llamadas en texto para alimentar un CRM o una base de conocimiento
- Generar subtítulos con marcas de tiempo (SRT/VTT) para redes sociales
Puntos fuertes
- + Abierto y gratuito para autoalojar, con licencia MIT sin restricciones comerciales
- + Buena precisión en español y 98 idiomas en total
- + API muy barata (desde 0,0045 $/min con gpt-transcribe) y con opción de tiempo real
- + Enorme ecosistema de herramientas derivadas (faster-whisper, whisper.cpp, WhisperX)
Limitaciones
- − Sin interfaz propia: requiere programar o usar un producto que lo integre
- − La API limita cada archivo a 25 MB y whisper-1 no separa hablantes
- − Los modelos grandes en local necesitan GPU para ir a velocidad razonable
Precio de Whisper (OpenAI)
Tiene plan gratuito. Planes: Modelo abierto gratis (MIT, autoalojado) · API: gpt-transcribe 0,0045 $/min · gpt-4o-mini-transcribe ≈0,003 $/min · whisper-1 0,006 $/min · gpt-4o-transcribe y gpt-4o-transcribe-diarize ≈0,006 $/min · gpt-live-transcribe 0,017 $/min. precios en developers.openai.com/api/docs/pricing a 16/09/2026; el modelo abierto solo cuesta el hardware donde se ejecuta
ORO://veredicto de agencia
Cuándo la elegiríamos nosotros
Lo usamos como motor de transcripción dentro de automatizaciones y para audio que no puede salir del servidor del cliente; si hace falta una interfaz para el equipo, un notetaker como tl;dv o Fireflies resuelve antes.
Preguntas frecuentes sobre Whisper (OpenAI)
¿Whisper (OpenAI) es gratis?
Sí, tiene plan gratuito. Planes: Modelo abierto gratis (MIT, autoalojado) · API: gpt-transcribe 0,0045 $/min · gpt-4o-mini-transcribe ≈0,003 $/min · whisper-1 0,006 $/min · gpt-4o-transcribe y gpt-4o-transcribe-diarize ≈0,006 $/min · gpt-live-transcribe 0,017 $/min. precios en developers.openai.com/api/docs/pricing a 16/09/2026; el modelo abierto solo cuesta el hardware donde se ejecuta
¿Whisper (OpenAI) funciona en español?
Sí. Whisper (OpenAI) funciona en español, tanto la interfaz como los resultados en la mayoría de casos.
¿Para quién es Whisper (OpenAI)?
Modelo de reconocimiento de voz de OpenAI, abierto (licencia MIT) y multilingüe; para transcribir audio en local o vía API a bajo coste. Nivel recomendado: avanzado. Lo usamos como motor de transcripción dentro de automatizaciones y para audio que no puede salir del servidor del cliente; si hace falta una interfaz para el equipo, un notetaker como tl;dv o Fireflies resuelve antes.
Fuentes: github.com · developers.openai.com · developers.openai.com