Qué es
Autocine es una fábrica de videos. Le decís un tema y sale un video terminado: con guion, voz en off, imágenes de apoyo y ritmo de edición. Pensado para canales de divulgación que publican seguido sin quemarse en la edición.
Entrada: "¿Cómo funcionan los agujeros negros?"
Salida: un .mp4 de 3 minutos listo para subir.
El pipeline
tema → guion (IA) → narración (TTS) → imágenes → edición (ffmpeg) → video
Cada etapa es un módulo independiente. Podés correr una sola, cambiar el motor de guion o el de imágenes sin tocar el resto.
1. Guion
El modelo de lenguaje arma un guion con estructura de video corto: hook en los primeros 15 segundos, explicación en bloques, y cierre con remate. Cada bloque se marca con una timeline que después sincroniza voz e imágenes:
[
{"ti": 0, "tf": 4, "texto": "En el centro de cada galaxia..."},
{"ti": 4, "tf": 9, "texto": "hay algo tan denso que la luz..."},
...
]
2. Narración
Cada bloque del guion se convierte en audio con TTS en español. Acá aparece la parte fina del sistema: la voz se genera por bloque y después se mide la duración real de cada audio para ajustar la timeline. La edición nunca se descuadra.
def narrar(bloques):
audios = [tts(b["texto"]) for b in bloques] # TTS por bloque
return medir_duraciones(audios) # duraciones reales
3. Imágenes
Para cada bloque se genera una imagen con IA a partir de una descripción derivada del texto. Las imágenes se animan con un zoom lento (efecto Ken Burns) para que el video nunca se sienta estático.
4. Edición
Todo se junta con ffmpeg en un solo comando generado por el sistema:
video final = imágenes animadas + narración + transiciones + texto de apoyo
- Transiciones suaves entre bloques.
- Textos del título y capítulos quemados en el video.
- Silencio de 0.3s entre bloques para que la narración respire.
- Ajuste de loudness final para que no se escuche fuerte o flojo según el dispositivo.
Resultados
- 1 video de ~3 min por corrida, sin intervención.
- Consistente: mismo estilo, misma voz, misma calidad en cada video.
- El pipeline deja el proyecto editable por si querés ajustar algo a mano.
Lo que aprendí
- La sincronización audio/imagen es el problema real; el resto es juntar piezas.
- Medir duraciones reales del TTS antes de editar evita el 90% de los descuadres.
- ffmpeg es brutalmente potente cuando aprendés a generar sus comandos en vez de escribirlos a mano.
Siguiente paso
Conectarle el canal de YouTube para que, además de producir el video, lo suba, le ponga título y miniatura, y programe la publicación. Producción de contenido 100% automática.