CCitopendia

Guía Whisper: transcripción de audio gratuita de OpenAI

Publicado 27. marzo 2026

Guía Whisper: transcripción de audio gratuita de OpenAI

Whisper es el modelo de reconocimiento de voz de código abierto desarrollado por OpenAI. Entrenado con más de 680.000 horas de audio multilingüe, Whisper es capaz de transcribir audio con una precisión excepcional en múltiples idiomas, traducir audio a inglés e identificar automáticamente el idioma hablado. Lo más destacable es que Whisper es completamente gratuito cuando se ejecuta localmente, lo que lo convierte en una de las herramientas de transcripción más accesibles y potentes del mercado.

En esta guía completa te explicamos cómo funciona Whisper, cómo instalarlo y usarlo, sus distintas versiones, trucos para obtener los mejores resultados y las mejores alternativas.

Cómo empezar con Whisper

Existen varias formas de usar Whisper, desde la instalación local hasta servicios online y la API de OpenAI:

Opción 1: Instalación local (gratuita)

  1. Requisitos previos: Necesitas Python 3.8 o superior y pip instalados. Para un rendimiento óptimo, se recomienda una GPU NVIDIA con al menos 4 GB de VRAM.
  2. Instala Whisper: Abre la terminal y ejecuta: pip install openai-whisper
  3. Instala FFmpeg: Whisper necesita FFmpeg para procesar archivos de audio. Instálalo con tu gestor de paquetes (por ejemplo, brew install ffmpeg en Mac o sudo apt install ffmpeg en Ubuntu).
  4. Transcribe un archivo: Ejecuta: whisper audio.mp3 --language es --model turbo
  5. Elige el formato de salida: Whisper genera texto plano, SRT (subtítulos), VTT y JSON. Especifica con --output_format.

Opción 2: API de OpenAI (de pago)

  1. Crea una cuenta de OpenAI: Regístrate en platform.openai.com y obtén una clave API.
  2. Envía el audio: Usa la API para enviar archivos de audio de hasta 25 MB. El coste es de 0,006 $ por minuto de audio.
  3. Recibe la transcripción: La API devuelve la transcripción en formato JSON, texto, SRT o VTT.

Opción 3: Interfaces web gratuitas

Existen varias interfaces web que permiten usar Whisper sin instalar nada: Hugging Face Spaces aloja una versión gratuita, y hay aplicaciones como WhisperTranscribe que ofrecen interfaces amigables sobre el modelo de Whisper.

Funciones principales de Whisper

Transcripción multilingüe

Whisper puede transcribir audio en múltiples idiomas con alta precisión. El modelo ha sido entrenado con audio en decenas de idiomas, incluyendo español, inglés, francés, alemán, portugués, italiano, chino, japonés, árabe y muchos más.

Traducción automática a inglés

Además de transcribir, Whisper puede traducir automáticamente audio en cualquier idioma a texto en inglés. Esta función es especialmente útil para hacer accesible contenido en idiomas extranjeros.

Detección automática de idioma

Whisper identifica automáticamente el idioma del audio sin necesidad de especificarlo manualmente. Esto facilita el procesamiento de archivos con idiomas desconocidos o mixtos.

Múltiples modelos de distintos tamaños

Whisper ofrece varios tamaños de modelo, cada uno con un equilibrio diferente entre velocidad y precisión:

  • tiny: El más rápido, requiere ~1 GB de VRAM. Precisión básica.
  • base: Buen equilibrio para pruebas rápidas. ~1 GB de VRAM.
  • small: Mejor precisión, ~2 GB de VRAM.
  • medium: Alta precisión, ~5 GB de VRAM.
  • large-v3: Máxima precisión, ~10 GB de VRAM.
  • turbo: Versión optimizada de large-v3 con velocidad significativamente mayor y precisión mínimamente inferior.

Formatos de salida múltiples

Whisper genera la transcripción en varios formatos: texto plano (.txt), subtítulos SRT (.srt), subtítulos VTT (.vtt), JSON detallado con marcas de tiempo y JSON verboso con información adicional de segmentos.

Soporte para múltiples formatos de audio

Whisper acepta los formatos de audio más comunes: MP3, MP4, MPEG, MPGA, M4A, WAV y WebM. Los archivos se limitan a 25 MB cuando se usa la API, pero no hay límite cuando se ejecuta localmente.

Trucos y consejos para Whisper

  • Usa el modelo turbo para el mejor equilibrio: El modelo turbo ofrece una velocidad de transcripción significativamente mayor que large-v3 con una degradación de precisión mínima. Es la opción recomendada para la mayoría de usos.
  • Preprocesa el audio: Si el audio tiene mucho ruido de fondo, usa herramientas como Audacity para limpiar el audio antes de transcribirlo. Esto mejora significativamente la precisión.
  • Especifica el idioma: Aunque Whisper puede detectar el idioma automáticamente, especificarlo con --language es mejora la precisión y velocidad de la transcripción.
  • Usa GPU si es posible: La transcripción con GPU NVIDIA es entre 5 y 50 veces más rápida que con CPU, dependiendo del tamaño del modelo. Si no tienes GPU, Google Colab ofrece acceso gratuito a GPUs.
  • Divide archivos grandes: Para archivos de audio muy largos (más de 1 hora), dividirlos en segmentos de 15-30 minutos mejora la precisión y el rendimiento.
  • Genera subtítulos SRT: Usa --output_format srt para generar archivos de subtítulos listos para usar en editores de vídeo o plataformas como YouTube.
  • Combina con traducción: Si necesitas subtítulos en inglés de un audio en español, usa la función de traducción: whisper audio.mp3 --task translate

Precios de Whisper

MétodoPrecioCaracterísticas
Local (código abierto)GratuitoSin límites, requiere hardware propio (GPU recomendada)
API de OpenAI (whisper-1)0,006 $/minArchivos hasta 25 MB, sin necesidad de hardware
API (gpt-4o-transcribe)VariableModelo más avanzado con mejor precisión
Interfaces web gratuitasGratuitoSin instalación, limitaciones de tamaño de archivo

La principal ventaja de Whisper es que, al ser código abierto, puedes ejecutarlo localmente de forma completamente gratuita y sin límites. Solo necesitas un ordenador con una GPU compatible.

Alternativas a Whisper

  • ElevenLabs: Aunque es conocido por síntesis de voz, ElevenLabs también ofrece funciones de transcripción y puede complementar a Whisper en flujos de trabajo de audio completos.
  • ChatGPT: ChatGPT incluye funciones de voz que pueden transcribir audio en conversaciones, aunque no está optimizado para transcripción de archivos largos.
  • Google Gemini: Google Gemini soporta entrada de audio y puede transcribir y analizar conversaciones grabadas.
  • Microsoft Copilot: Microsoft Copilot integra funciones de transcripción en las aplicaciones de Microsoft 365 como Teams y Word.
  • Google Cloud Speech-to-Text: Servicio de transcripción empresarial de Google con soporte para más de 125 idiomas y modelos especializados por industria.

Preguntas frecuentes sobre Whisper

¿Es gratis Whisper?

Sí, Whisper es un modelo de código abierto que puedes ejecutar localmente de forma completamente gratuita. También puedes usarlo a través de la API de OpenAI a 0,006 $/minuto o mediante interfaces web gratuitas.

¿En cuántos idiomas funciona Whisper?

Whisper soporta transcripción en decenas de idiomas. Los mejores resultados se obtienen en inglés, español, francés, alemán, italiano, portugués y otros idiomas europeos principales, aunque también soporta idiomas asiáticos, árabes y otros.

¿Necesito una GPU para usar Whisper?

No es obligatorio, pero sí altamente recomendable. Sin GPU, la transcripción puede ser entre 5 y 50 veces más lenta. Se recomienda una GPU NVIDIA con al menos 4 GB de VRAM. Alternativamente, puedes usar la API de OpenAI o interfaces web que procesan el audio en la nube.

¿Whisper puede generar subtítulos automáticos?

Sí, Whisper genera subtítulos en formato SRT y VTT con marcas de tiempo precisas. Estos archivos son compatibles con la mayoría de editores de vídeo y plataformas como YouTube.

¿Cuál es el mejor modelo de Whisper?

El modelo turbo es el más recomendado para la mayoría de usos, ya que ofrece velocidad significativamente mayor que large-v3 con una degradación de precisión mínima. Para máxima precisión sin importar la velocidad, usa large-v3.

¿Puedo transcribir archivos muy largos?

Sí, cuando ejecutas Whisper localmente no hay límite de tamaño de archivo. La API de OpenAI tiene un límite de 25 MB por archivo. Para archivos locales muy largos, dividirlos en segmentos de 15-30 minutos mejora la precisión.

¿Whisper puede traducir audio?

Sí, Whisper puede traducir audio de cualquier idioma soportado a texto en inglés. Usa el parámetro --task translate para activar esta función.