Cómo usar WhisperX en Google Colab (2025)

WhisperX es un pipeline avanzado de reconocimiento de voz construida sobre Whisper, el modelo ASR de código abierto de OpenAI. Funciona en PyTorch y, aunque puede operar sobre CPU, el rendimiento mejora muchísimo con una GPU compatible con CUDA (es decir, NVIDIA). WhisperX mejora al modelo original con una alineación más precisa y veloz, soporte para modelos más grandes y diferenciación de voces (diarización) opcional. El resultado son transcripciones de alta calidad con marcas de tiempo a nivel de palabra e identificación clara de cada hablante y asegura ser hasta 70x más rápìdo que el modelo original

Mi compu no tiene una GPU con soporte para CUDA, así que ejecuto WhisperX en Google Colab y este es un tutorial corto de cómo lo configuro y uso en ese entorno en la nube.

Leer más…

textual-tetris, un tetris en la terminal

Como sigo sin empleo priorizando la búsqueda de salud mental, dedico mi tiempo ñoño a dos loables tareas:

  1. Colaborar con organizaciones que necesitan soluciones tecnológicas pero no tienen el presupuesto para competir con el mercado por mis conocimientos.
  2. La que compete a este post: aprender cosas nuevas implementando ideas viejas del TO DO permanente que anoto acá), para las que rara vez encontraba el tiempo.

Esta vez quería aprender un poco sobre Textual (hermano mayor de rich), el gran framework en Python para hacer interfaces gráficas basadas en texto, las famosas TUIs.

Y ya que estaba, aprendí a hacer un Tetris que es bastante digno de jugar, no se ve taaan feo, y actualmente tiene menos de 600 líneas contando los comentarios y se ve así:

Pero una probadita vale más que mil capturas: abrí una terminal y si tenés uv instalado (¡deberías!) ejecutá:

uvx textual-tetris 

Y ya estás jugando Tetris!

Leer más…