Cómo usar Whisper para sacar el texto de un video

 

Cómo usar Whisper para sacar el texto de un video

Whisper es el modelo de reconocimiento de voz de OpenAI, de código abierto, que permite transcribir audio de videos con una precisión impresionante y, lo más importante, de forma local y sin necesidad de conexión a internet. Esto significa que tus archivos nunca salen de tu computadora, garantizando la privacidad de tus datos.

A continuación, te guiaré paso a paso por las tres formas más comunes de usarlo, desde la más sencilla para principiantes hasta opciones para usuarios más avanzados.


🚀 Opción 1: La más fácil para empezar (Buzz)

Si no te sientes cómodo usando la línea de comandos, Buzz es la mejor opción. Esta aplicación gratuita funciona como una interfaz gráfica amigable para Whisper, permitiéndote obtener una transcripción y un archivo de subtítulos .srt para tu video con solo unos clics.

Pasos a seguir:

  1. Descarga e instala Buzz: Ve a la página de lanzamientos de Buzz en GitHub y descarga el instalador para tu sistema operativo (Windows, macOS o Linux).

  2. Prepara tu video: Asegúrate de tener tu archivo de video (por ejemplo, .mp4, .mkv) guardado en tu computadora.

  3. Inicia la transcripción:

    • Abre la aplicación Buzz.

    • Arrastra y suelta tu archivo de video en la ventana principal.

    • Aparecerá una ventana de configuración. Para un buen equilibrio entre precisión y velocidad, te recomiendo seleccionar el modelo Whisper (Medium).

    • Haz clic en Run y espera a que el proceso termine.

  4. Exporta el resultado:

    • Cuando el estado cambie a Completed, haz doble clic en la tarea para abrir el visor de la transcripción.

    • Usa el botón Export para guardar el texto. Si necesitas subtítulos para tu video, elige el formato .srt .


💻 Opción 2: Usando la línea de comandos (La más común)

Para los que prefieren la línea de comandos, Whisper se instala y ejecuta fácilmente con Python. Esta es la forma más directa y poderosa de usar el modelo.

Requisitos previos

Antes de empezar, necesitas instalar dos cosas:

  • FFmpeg: Es una herramienta esencial para que Whisper pueda procesar el audio de los videos.

    • Windows: Descarga un ejecutable de ffmpeg.org y añade la carpeta bin a la variable de entorno PATH de tu sistema.

    • macOS: Abre la Terminal y ejecuta brew install ffmpeg (necesitas tener Homebrew instalado).

    • Linux (Ubuntu/Debian): Ejecuta sudo apt update && sudo apt install ffmpeg.

  • Python: Asegúrate de tener Python 3.8 o superior instalado en tu sistema.

Instalación de Whisper

  1. Abre tu terminal o línea de comandos.

  2. Instala Whisper usando pip:

    bash
    pip install -U openai-whisper

Transcripción de tu video

Una vez instalado, el proceso es muy sencillo. Navega hasta la carpeta donde tienes tu video y ejecuta el siguiente comando:

bash
whisper "ruta/a/tu/video.mp4" --model small --language Spanish

Explicación de los parámetros:

  • "ruta/a/tu/video.mp4": Reemplaza con la ruta real a tu archivo de video.

  • --model small: Especifica el modelo a usar. Si no lo pones, usará base por defecto. small es un excelente punto de partida por su equilibrio entre velocidad y precisión.

  • --language Spanish: Indica el idioma del audio. Si no lo especificas, Whisper lo detectará automáticamente, lo que puede añadir un pequeño retraso.

¿Qué modelo elegir?

ModeloTamañoVelocidadPrecisiónMejor para
tiny39 MBMuy rápidaBajaPruebas rápidas, hardware limitado
base74 MBRápidaBuenaUso general, archivos cortos
small244 MBModeradaMejorLa mayoría de los casos de uso
medium769 MBLentaAltaTranscripciones precisas, contenido largo
large1.5 GBMuy lentaExcelentePrecisión profesional, investigación

Resultados

Al terminar, Whisper generará varios archivos en la misma carpeta que tu video:

  • .txt: Un archivo de texto simple con la transcripción completa.

  • .srt: Un archivo de subtítulos con marcas de tiempo, listo para usar en tu reproductor de video.

  • .vtt: Otro formato común para subtítulos en la web.


☁️ Opción 3: Usar Google Colab (Sin instalar nada)

Si no quieres instalar nada en tu computadora o quieres usar la potencia de una GPU gratuita en la nube, esta opción es perfecta. Google Colab te permite ejecutar código Python en un entorno virtual sin configuración.

Pasos a seguir:

  1. Abre Google Colab: Ve a colab.research.google.com y crea un nuevo notebook.

  2. Configura la GPU (opcional pero recomendado): Ve al menú Entorno de ejecución -> Cambiar tipo de entorno de ejecución y selecciona GPU como acelerador de hardware.

  3. Instala Whisper y FFmpeg: En la primera celda del notebook, pega y ejecuta el siguiente código:

    python
    !pip install git+https://github.com/openai/whisper.git
    !sudo apt update && sudo apt install ffmpeg
    ```[citation:5]
  4. Sube tu archivo de audio/video: En una nueva celda, ejecuta este código para subir tu archivo desde tu computadora:

    python
    from google.colab import files
    uploaded = files.upload()

    Sube tu archivo de video o audio.

  5. ¡Transcribe!: Ejecuta el siguiente comando en una nueva celda, reemplazando "nombre_de_tu_video.mp4" con el nombre real de tu archivo:

    bash
    !whisper "nombre_de_tu_video.mp4" --model medium --language Spanish
    ```[citation:5]
  6. Descarga los archivos: El resultado de la transcripción aparecerá en la salida de la celda. Los archivos .txt, .srt, etc., se generarán en el entorno de Colab. Puedes descargarlos usando el panel de archivos a la izquierda o con el siguiente código:

    python
    from google.colab import files
    files.download('nombre_de_tu_video.mp4.txt')

💡 Consejos para una mejor transcripción

  • Prompt: Puedes usar el parámetro --prompt en la línea de comandos para "guiar" a Whisper con un texto de ejemplo que imite el estilo o incluya nombres propios o jerga específica que quieras que reconozca correctamente. Por ejemplo: --prompt "El nombre del producto es FooBar y se pronuncia...".

  • Traducción: Si tu video está en otro idioma y quieres la transcripción en inglés, usa el parámetro

Comentarios

Entradas más populares de este blog

Tutorial 18: Creando la Página de Visualización de Archivos Recientes

Tutorial 11: ¿Qué es Whisper AI y Cómo Funciona?