Cómo usar Whisper para sacar el texto de un video
Cómo usar Whisper para sacar el texto de un video
Whisper es el modelo de reconocimiento de voz de OpenAI, de código abierto, que permite transcribir audio de videos con una precisión impresionante y, lo más importante, de forma local y sin necesidad de conexión a internet. Esto significa que tus archivos nunca salen de tu computadora, garantizando la privacidad de tus datos.
A continuación, te guiaré paso a paso por las tres formas más comunes de usarlo, desde la más sencilla para principiantes hasta opciones para usuarios más avanzados.
🚀 Opción 1: La más fácil para empezar (Buzz)
Si no te sientes cómodo usando la línea de comandos, Buzz es la mejor opción. Esta aplicación gratuita funciona como una interfaz gráfica amigable para Whisper, permitiéndote obtener una transcripción y un archivo de subtítulos .srt para tu video con solo unos clics.
Pasos a seguir:
Descarga e instala Buzz: Ve a la página de lanzamientos de Buzz en GitHub y descarga el instalador para tu sistema operativo (Windows, macOS o Linux).
Prepara tu video: Asegúrate de tener tu archivo de video (por ejemplo,
.mp4,.mkv) guardado en tu computadora.Inicia la transcripción:
Exporta el resultado:
💻 Opción 2: Usando la línea de comandos (La más común)
Para los que prefieren la línea de comandos, Whisper se instala y ejecuta fácilmente con Python. Esta es la forma más directa y poderosa de usar el modelo.
Requisitos previos
Antes de empezar, necesitas instalar dos cosas:
FFmpeg: Es una herramienta esencial para que Whisper pueda procesar el audio de los videos.
Windows: Descarga un ejecutable de ffmpeg.org y añade la carpeta
bina la variable de entornoPATHde tu sistema.macOS: Abre la Terminal y ejecuta
brew install ffmpeg(necesitas tener Homebrew instalado).Linux (Ubuntu/Debian): Ejecuta
sudo apt update && sudo apt install ffmpeg.
Python: Asegúrate de tener Python 3.8 o superior instalado en tu sistema.
Instalación de Whisper
Abre tu terminal o línea de comandos.
Instala Whisper usando pip:
pip install -U openai-whisper
Transcripción de tu video
Una vez instalado, el proceso es muy sencillo. Navega hasta la carpeta donde tienes tu video y ejecuta el siguiente comando:
whisper "ruta/a/tu/video.mp4" --model small --language Spanish
Explicación de los parámetros:
"ruta/a/tu/video.mp4": Reemplaza con la ruta real a tu archivo de video.--model small: Especifica el modelo a usar. Si no lo pones, usarábasepor defecto.smalles un excelente punto de partida por su equilibrio entre velocidad y precisión.--language Spanish: Indica el idioma del audio. Si no lo especificas, Whisper lo detectará automáticamente, lo que puede añadir un pequeño retraso.
¿Qué modelo elegir?
Resultados
Al terminar, Whisper generará varios archivos en la misma carpeta que tu video:
.txt: Un archivo de texto simple con la transcripción completa..srt: Un archivo de subtítulos con marcas de tiempo, listo para usar en tu reproductor de video..vtt: Otro formato común para subtítulos en la web.
☁️ Opción 3: Usar Google Colab (Sin instalar nada)
Si no quieres instalar nada en tu computadora o quieres usar la potencia de una GPU gratuita en la nube, esta opción es perfecta. Google Colab te permite ejecutar código Python en un entorno virtual sin configuración.
Pasos a seguir:
Abre Google Colab: Ve a
colab.research.google.comy crea un nuevo notebook.Configura la GPU (opcional pero recomendado): Ve al menú
Entorno de ejecución->Cambiar tipo de entorno de ejecucióny seleccionaGPUcomo acelerador de hardware.Instala Whisper y FFmpeg: En la primera celda del notebook, pega y ejecuta el siguiente código:
!pip install git+https://github.com/openai/whisper.git !sudo apt update && sudo apt install ffmpeg ```[citation:5]
Sube tu archivo de audio/video: En una nueva celda, ejecuta este código para subir tu archivo desde tu computadora:
from google.colab import files uploaded = files.upload()
¡Transcribe!: Ejecuta el siguiente comando en una nueva celda, reemplazando
"nombre_de_tu_video.mp4"con el nombre real de tu archivo:!whisper "nombre_de_tu_video.mp4" --model medium --language Spanish ```[citation:5]
Descarga los archivos: El resultado de la transcripción aparecerá en la salida de la celda. Los archivos
.txt,.srt, etc., se generarán en el entorno de Colab. Puedes descargarlos usando el panel de archivos a la izquierda o con el siguiente código:from google.colab import files files.download('nombre_de_tu_video.mp4.txt')
💡 Consejos para una mejor transcripción
Prompt: Puedes usar el parámetro
--prompten la línea de comandos para "guiar" a Whisper con un texto de ejemplo que imite el estilo o incluya nombres propios o jerga específica que quieras que reconozca correctamente. Por ejemplo:--prompt "El nombre del producto es FooBar y se pronuncia...".Traducción: Si tu video está en otro idioma y quieres la transcripción en inglés, usa el parámetro
Comentarios
Publicar un comentario