El repositorio se sitúa entre las herramientas de video de un solo clic y una canalización de medios local. Admite un paquete todo en uno para Windows, instalaciones desde el código fuente con `uv`, una Web UI de Streamlit, un servidor FastAPI, flujos de trabajo de ComfyUI/RunningHub, proveedores de medios mediante API directa, Edge-TTS/Index-TTS, plantillas, historial y múltiples canalizaciones de generación.
Get the latest on AI, LLMs & developer tools
New MCP servers, model updates, and guides like this one — delivered weekly.
Nota editorial
Este artículo se basa en el repositorio de GitHub, el README/README en inglés, la documentación, pyproject, el ejemplo de configuración, el servicio principal, la aplicación API, las notas de la versión, los problemas actuales y las PR actuales investigadas el 3 de junio de 2026. La guía de configuración prefiere `pyproject.toml` cuando la documentación y los metadatos del paquete no coinciden.
1. Pixelle-Video en una frase
Pixelle-Video es un motor de automatización de video corto en Python con licencia Apache 2.0 que incluye Web UI de Streamlit, rutas de FastAPI, generación de guiones mediante LLM, TTS, flujos de trabajo de ComfyUI/RunningHub, API directas de imagen/video, plantillas, canalizaciones, persistencia e historial.
| Área | Detalle | Por qué importa |
|---|---|---|
| Repositorio | AIDC-AI/Pixelle-Video | https://github.com/AIDC-AI/Pixelle-Video |
| Lenguaje principal | Python | Lenguaje principal de GitHub en el momento de la investigación. |
| Licencia | Apache 2.0 | Revisa por separado las licencias empaquetadas o binarias cuando corresponda. |
| Creado | 7 de noviembre de 2025 | Última versión de GitHub verificada: v0.1.15 el 27 de enero de 2026; main tenía cambios más recientes hasta junio de 2026. |
2. Por qué importa
El proyecto es importante porque la generación de videos cortos no se limita a una sola llamada de modelo. Un video utilizable requiere generación de guiones, planificación de escenas, generación de imágenes o videos, síntesis de voz, temporización, diseño de plantillas, BGM, composición, exportación y revisión.
La contribución útil de Pixelle-Video es la orquestación. Ofrece a los usuarios una Web UI y una estructura de canalización para conectar LLMs, ComfyUI, RunningHub, API de medios directas, motores TTS, plantillas y pasos de composición al estilo FFmpeg.
También es un recordatorio de que las herramientas de medios con IA local son operativamente pesadas. Ejecutar todo de forma local generalmente significa usar un LLM local u Ollama, además de ComfyUI local, nodos de flujo de trabajo, FFmpeg y TTS. Las rutas en la nube/API son más sencillas, pero introducen costos de proveedor y configuración de credenciales.
3. Arquitectura y modelo mental
Pixelle-Video está organizado en torno a un coordinador de servicio central, Web UI de Streamlit, aplicación FastAPI, servicios de medios/TTS/LLM, múltiples canalizaciones, carpetas de plantillas, carpetas de flujo de trabajo, archivos de configuración y capas de persistencia/historial.
| Área | Detalle | Por qué importa |
|---|---|---|
| Web UI | `web/app.py` | Punto de entrada de Streamlit para configuración, entrada de contenido, ajustes de voz/visuales y generación. |
| Servidor API | `api/app.py` | Aplicación FastAPI con routers para health, LLM, TTS, imagen, contenido, video, tareas, archivos, recursos y frames. |
| Coordinador central | `pixelle_video/service.py` | Inicializa servicios y registra pipelines. |
| Pipelines | `pixelle_video/pipelines/*` | Abstracciones de pipeline estándar, personalizadas, basadas en activos, lineales y base. |
| Servicios | `pixelle_video/services/*` | LLM, TTS, API media, Comfy media, video, procesamiento de fotogramas, persistencia, historial y análisis. |
| Plantillas | `templates/` | Plantillas HTML en formato vertical, cuadrado y horizontal para el renderizado de escenas. |
| Flujos de trabajo | `workflows/` | Grupos de flujos de trabajo de RunningHub y ComfyUI autohospedados. |
| Configuración | `config.example.yaml` | LLM, proveedores de API, ComfyUI, RunningHub, valores predeterminados de TTS/imagen/video y plantillas. |
4. Configuración end-to-end mínima
Los comandos de abajo se copiaron de la documentación del repositorio y se contrastaron con la instantánea de investigación actual. Úsalos como punto de partida y lee después el README enlazado antes de instalarlo en producción.
# Windows recommended path
# 1. Download the latest all-in-one package from releases/latest
# 2. Extract it
# 3. Run start.bat
# 4. Open http://localhost:8501
# Source path
git clone https://github.com/AIDC-AI/Pixelle-Video.git
cd Pixelle-Video
uv run streamlit run web/app.pyUna primera tarea pequeña debe demostrar la integración antes de conectarla a datos críticos o workspaces grandes.
# Alternative source setup shown in docs
uv sync
streamlit run web/app.py
# REST API server
uv run uvicorn api.app:app --host 0.0.0.0 --port 8000
# Stronger version source:
# pyproject.toml requires Python >= 3.11.5. Análisis técnico profundo
5.1 La pipeline convierte un prompt en pasos de producción
El README de Pixelle-Video describe el flujo principal como generación de guiones, planificación de imágenes, procesamiento cuadro por cuadro y composición de video. La estructura del código refuerza esto con un objeto de servicio central, servicios específicos de medios/TTS/LLM y clases de pipeline.
Esto es importante porque la generación de videos cortos falla en los límites. Un buen guion aún puede producir una mala sincronización de escenas. Una buena imagen puede no coincidir con la voz. Un buen archivo TTS puede romper la composición. Una pipeline le da a cada etapa un lugar designado para validar y depurar.
topic or fixed script
-> LLM narration / script
-> scene and visual planning
-> images or video clips
-> TTS voice
-> template rendering
-> video composition
-> preview, history, export5.2 ComfyUI, RunningHub y las API directas son modos de ejecución diferentes
Pixelle-Video admite flujos de trabajo locales de ComfyUI, flujos de trabajo en la nube de RunningHub y proveedores de medios de API directas como DashScope/Wan, OpenAI image, Seedream/Seedance, Kling y servicios similares.
Los usuarios no deben tratarlos como intercambiables. ComfyUI local brinda control pero requiere nodos y activos de modelos. RunningHub reduce la configuración local pero utiliza un flujo de trabajo en la nube. Las API directas son más simples para proveedores específicos, pero requieren claves, URLs base, límites y parámetros específicos del proveedor.
5.3 La Web UI es la superficie del producto
El README explica una interfaz de Streamlit de tres columnas: entrada de contenido, configuración de voz/visual y salida de generación. La configuración inicial incluye la configuración del LLM, ComfyUI/RunningHub y la configuración del modelo de medios de la API.
Esa Web UI es importante porque el usuario objetivo no es necesariamente un desarrollador de Python. Un motor de video con diez archivos de configuración es potente; una Web UI con ajustes preestablecidos de modelos, vistas previas y configuración guardada es utilizable.
5.4 Las plantillas separan el diseño de la generación de medios.
El sistema de plantillas admite plantillas estáticas, de imagen y de video, con carpetas para formato vertical, cuadrado y horizontal. Esa es la separación correcta: la IA crea o selecciona los medios, mientras que las plantillas definen cómo aparecen el texto, el fondo, los clips y la sincronización.
Esto también ofrece a los usuarios avanzados una ruta de personalización. Si puedes escribir plantillas HTML/CSS, puedes crear un estilo propio sin tener que reescribir todo el pipeline de generación.
5.5 Local no significa sin fricción.
Los problemas recientes muestran puntos críticos predecibles: nodos faltantes en ComfyUI, fallos en la síntesis local, inestabilidad de Edge TTS, Ollama local devolviendo respuestas vacías en macOS y confusión cuando la generación parece usar modelos en la nube a pesar de la configuración local de ComfyUI.
Eso no invalida el proyecto. Significa que una lista de verificación de instalación realista debe incluir Python >=3.11, `uv`, FFmpeg, claves de proveedor o servicios locales, nodos de flujo de trabajo de ComfyUI y una pequeña prueba de extremo a extremo antes de intentar un video largo.
6. Patrones reales: incorrecto vs correcto
| Incorrecto | Correcto | Razón |
|---|---|---|
| Asume que el paquete de Windows y la instalación desde el código fuente tienen la misma configuración. | Usa el paquete todo en uno para Windows para obtener la menor fricción en Windows; usa el código fuente para la personalización. | El paquete incluye las dependencias, mientras que el código fuente requiere herramientas locales. |
| Asume que ComfyUI local significa que cada paso es local. | Verifica los flujos de trabajo seleccionados y la configuración del proveedor de medios de la API. | El issue #188 muestra que el enrutamiento local frente a la nube puede confundir a los usuarios. |
| Usa la documentación que indica Python 3.10+ como única fuente. | Prefiere el requisito de Python >=3.11 de `pyproject.toml`. | Los metadatos del paquete son más estrictos y cercanos a la resolución de la instalación. |
| Ignora los PR de seguridad abiertos para despliegues de la API. | Revisa las rutas de servicio de archivos y el PR #175 antes de exponer el servidor de la API. | Un PR abierto alega un problema de recorrido de ruta (path traversal). |
7. Errores comunes y problemas actuales
El issue tracker importa porque estos repos son jóvenes y cambian rápido. El artículo usa los issues como señales de riesgo, no como prueba de que el proyecto sea inutilizable.
| Área | Detalle | Por qué importa |
|---|---|---|
| Versión de Python | La documentación menciona 3.10+, mientras que `pyproject.toml` requiere >=3.11. | Utilice Python 3.11 o superior. |
| Nodos de ComfyUI | El issue #182 reporta errores de nodos faltantes. | Instale los nodos de flujo de trabajo requeridos antes de culpar a Pixelle. |
| Local vs nube | El issue #188 reporta que la generación sigue utilizando el proveedor en la nube a pesar de la configuración local de ComfyUI. | Verifique la selección de flujo de trabajo/proveedor. |
| Fiabilidad de TTS | Los informes de problemas indican fallos en Edge TTS y en la síntesis local. | Mantener opciones de TTS de respaldo. |
| Composición de video | El problema #187 informa de interrupciones entre los segmentos compuestos. | Inspeccionar la velocidad de fotogramas, las transiciones y la duración de los clips. |
| Seguridad de la API | El PR #175 abierto corrige un supuesto recorrido de ruta de archivos. | No exponer servidores de API sin revisar públicamente. |
8. Notas de rendimiento, escalado y coste
La etapa más lenta suele ser la generación de medios, no el script del LLM. El rendimiento local de ComfyUI depende de la GPU, la complejidad del flujo de trabajo, el tamaño del modelo y la disponibilidad de nodos. La generación de video mediante API directa depende de la cola del proveedor y de los límites de tasa.
TTS y la composición crean sus propios cuellos de botella. La vista previa de voz es económica; la narración completa más la sincronización por escena y la composición de video pueden revelar casos extremos solo después de un renderizado completo.
El bucle de evaluación más económico es un video pequeño: un guion corto, una o dos escenas, una voz TTS, una plantilla y un flujo de trabajo de imagen conocido como funcional. Escala solo después de que esa ruta tenga éxito.
9. Para quién es
| Úsalo si | Evítalo si |
|---|---|
| Quieres una canalización local/en la nube hackeable para la generación de videos cortos con IA. | Quieres un producto de video para el consumidor totalmente alojado y sin configuración. |
| Ya utilizas ComfyUI, RunningHub o APIs de modelos multimedia. | No quieres gestionar FFmpeg, Python, claves de modelos o nodos de flujo de trabajo. |
| Necesitas plantillas, TTS, BGM, historial, Web UI y superficies de API en un solo repositorio. | Solo necesitas una única llamada de API de imagen a video. |
| Puedes revisar los resultados antes de publicar. | Necesitas publicación de video automatizada y segura para la marca sin control de calidad humano. |
10. Señal de la comunidad
Los problemas recientes son prácticos y orientados al usuario: cómo ejecutar de forma totalmente local, por qué fallan los flujos de trabajo de ComfyUI, por qué el TTS es inestable, si se admite el uso en inglés/gratuito/pago por API, y por qué los clips generados tienen saltos.
Las PR recientes muestran que el proyecto está ampliando sus capacidades de proveedor y API: soporte para streaming de API de LLM, generación de medios mediante API directa, generación de imágenes con Azure OpenAI, soporte para API de respuestas y nuevos proveedores.
La PR de seguridad abierta es importante. Incluso si solo usas la Web UI de Streamlit localmente, las rutas de API que sirven archivos requieren una revisión cuidadosa antes de su despliegue público.
11. El veredicto: ¿merece la pena usarlo?
Nuestra opinión
Usa Pixelle-Video si deseas un pipeline de video corto con IA flexible y hackeable, y puedes gestionar herramientas de medios locales o API de proveedores. Evítalo si necesitas un editor de video comercial sin configuración, generación garantizada solo local o un despliegue de API pública sin revisión de seguridad.
12. El panorama general
Pixelle-Video muestra hacia dónde se dirigen las herramientas de video con IA: no hacia un modelo único, sino hacia la orquestación de texto, voz, imagen, video, plantillas, tiempos y edición.
El problema difícil es la consistencia. El contenido de formato corto necesita visuales, tiempos, voz, diseño de texto y estilo coherentes. Herramientas como Pixelle son valiosas cuando hacen que ese pipeline sea inspeccionable y personalizable en lugar de ocultarlo detrás de un botón de caja negra.
13. Preguntas frecuentes
P: ¿Es Pixelle-Video totalmente gratuito?
Puede usar componentes locales como ComfyUI y modelos locales, pero muchos flujos de trabajo utilizan proveedores de nube/API que pueden requerir claves de pago. Verifica tus proveedores seleccionados de LLM, TTS, imagen y video.
P: ¿Puede ejecutarse completamente de forma local?
Algunos flujos pueden ser locales con herramientas como ComfyUI local y LLM locales, pero debes verificar la selección del flujo de trabajo y las dependencias. Problemas recientes muestran que los usuarios pueden enrutar accidentalmente a través de proveedores de nube.
P: ¿Qué versión de Python debería usar?
Usa Python 3.11 o superior porque `pyproject.toml` requiere >=3.11, aunque algunos documentos todavía mencionan 3.10+.
P: ¿Cuál es la diferencia entre ComfyUI y RunningHub?
ComfyUI es la ruta del motor de flujo de trabajo local; RunningHub es una ruta de flujo de trabajo en la nube. Los proveedores de medios mediante API directa son una tercera ruta con claves y parámetros específicos del proveedor.
P: ¿Puedo usar una API en lugar de la Web UI?
Sí. El repositorio incluye una aplicación FastAPI que puede iniciarse con `uv run uvicorn api.app:app --host 0.0.0.0 --port 8000`.
P: ¿Por qué fallan los flujos de trabajo de ComfyUI con errores de nodos faltantes?
Los flujos de trabajo de ComfyUI a menudo dependen de nodos y modelos personalizados. Instala los nodos/activos requeridos por el flujo de trabajo antes de volver a ejecutar la generación.
P: ¿Debo exponer el servidor de API públicamente?
No sin una revisión. Un PR abierto en el momento de la investigación corrigió un supuesto problema de recorrido de ruta en el servicio de archivos, por lo que el despliegue público requiere refuerzo de seguridad.
14. Glosario
| Área | Detalle | Por qué importa |
|---|---|---|
| ComfyUI | Motor de flujo de trabajo de IA local basado en nodos. | Utilizado para flujos de trabajo de imagen/video/TTS. |
| RunningHub | Ruta de ejecución de flujo de trabajo en la nube. | Alternativa a ComfyUI local. |
| Streamlit | Framework de Web UI para Python. | Capa de interfaz de usuario interactiva de Pixelle. |
| FastAPI | Framework de API para Python. | Superficie de la REST API de Pixelle. |
| TTS | Texto a voz. | Etapa de generación de narración. |
| Plantilla | Diseño de escena HTML. | Controla la presentación de video en formato vertical/cuadrado/horizontal. |
| FFmpeg | Cadena de herramientas de procesamiento de video/audio. | Requerido para la composición y el manejo de medios. |
15. Todas las fuentes y enlaces
Fuentes primarias
Issues y PRs
- Problema con FunASR/SenseVoice
- Problema de enrutamiento de ComfyUI local
- Problema de tartamudeo en segmentos de video
- Problema de síntesis local
- Problema de Edge TTS
- Problema de nodos faltantes en ComfyUI
- PR de API de LLM en streaming
- PR de parche para path traversal
- PR de generación de medios mediante API directa
Enlaces internos
16. Tabla de atribución de fuentes
| Área | Detalle | Por qué importa |
|---|---|---|
| README/documentación | Rutas de configuración, flujo de Web UI, configuración de proveedores, plantillas y explicaciones de flujo de trabajo. | Fuente principal. |
| pyproject/config | Requisito de Python, dependencias, valores predeterminados del proveedor, valores predeterminados del flujo de trabajo. | Fuente principal. |
| Árbol de fuentes | Streamlit, FastAPI, coordinador de servicios, pipelines, servicios, plantillas. | Fuente de la arquitectura. |
| Problemas | Generación local, TTS, ComfyUI, Ollama y advertencias de composición. | Señal de la comunidad. |
| PRs | Media de API directa, parche de seguridad, LLM en streaming, expansión de proveedores. | Señal de frescura. |
Get the Ultimate Antigravity Cheat Sheet
Join 5,000+ developers and get our exclusive PDF guide to mastering Gemini 3 shortcuts and agent workflows.
Related Guides
Humanizer Skill Guide
blader/humanizer: 29 AI-writing patterns, voice calibration, and a two-pass audit, all in one Claude Code skill.
Guides & FeaturesMastering Agent Skills
The open standard for portable AI agent expertise.
Guides & FeaturesAntigravity Workflows Guide
Create automation recipes with Turbo Mode and AgentKit 2.0.
Guides & FeaturesHow to Change Antigravity Themes
Customize themes, dark mode, icons, and color schemes.
Guides & FeaturesHow to Change Language
Switch Antigravity to Spanish, German, Japanese, and more.
Guides & FeaturesAntigravity Security Guide
Known vulnerabilities, safe settings, and hardening steps.