Proyecto · 12 de agosto de 2026

Autocine — Fábrica de videos automática

Un pipeline hecho desde cero que convierte un tema en un video listo para publicar: guion con IA, narración, imágenes y edición final. Produce un video de 3 minutos sin que nadie toque nada.

pythonvideoiaffmpegautomatizacion

Qué es

Autocine es una fábrica de videos. Le decís un tema y sale un video terminado: con guion, voz en off, imágenes de apoyo y ritmo de edición. Pensado para canales de divulgación que publican seguido sin quemarse en la edición.

Entrada: "¿Cómo funcionan los agujeros negros?"

Salida: un .mp4 de 3 minutos listo para subir.

El pipeline

tema → guion (IA) → narración (TTS) → imágenes → edición (ffmpeg) → video

Cada etapa es un módulo independiente. Podés correr una sola, cambiar el motor de guion o el de imágenes sin tocar el resto.

1. Guion

El modelo de lenguaje arma un guion con estructura de video corto: hook en los primeros 15 segundos, explicación en bloques, y cierre con remate. Cada bloque se marca con una timeline que después sincroniza voz e imágenes:

[
  {"ti": 0,    "tf": 4,  "texto": "En el centro de cada galaxia..."},
  {"ti": 4,    "tf": 9,  "texto": "hay algo tan denso que la luz..."},
  ...
]

2. Narración

Cada bloque del guion se convierte en audio con TTS en español. Acá aparece la parte fina del sistema: la voz se genera por bloque y después se mide la duración real de cada audio para ajustar la timeline. La edición nunca se descuadra.

def narrar(bloques):
    audios = [tts(b["texto"]) for b in bloques]   # TTS por bloque
    return medir_duraciones(audios)               # duraciones reales

3. Imágenes

Para cada bloque se genera una imagen con IA a partir de una descripción derivada del texto. Las imágenes se animan con un zoom lento (efecto Ken Burns) para que el video nunca se sienta estático.

4. Edición

Todo se junta con ffmpeg en un solo comando generado por el sistema:

video final = imágenes animadas + narración + transiciones + texto de apoyo
  • Transiciones suaves entre bloques.
  • Textos del título y capítulos quemados en el video.
  • Silencio de 0.3s entre bloques para que la narración respire.
  • Ajuste de loudness final para que no se escuche fuerte o flojo según el dispositivo.

Resultados

  • 1 video de ~3 min por corrida, sin intervención.
  • Consistente: mismo estilo, misma voz, misma calidad en cada video.
  • El pipeline deja el proyecto editable por si querés ajustar algo a mano.

Lo que aprendí

  • La sincronización audio/imagen es el problema real; el resto es juntar piezas.
  • Medir duraciones reales del TTS antes de editar evita el 90% de los descuadres.
  • ffmpeg es brutalmente potente cuando aprendés a generar sus comandos en vez de escribirlos a mano.

Siguiente paso

Conectarle el canal de YouTube para que, además de producir el video, lo suba, le ponga título y miniatura, y programe la publicación. Producción de contenido 100% automática.

← Todos los proyectos