FLUX 3: el nuevo modelo multimodal de Black Forest Labs que genera vídeo, imagen y audio a la vez

FLUX 3: el nuevo modelo multimodal de Black Forest Labs que genera vídeo, imagen y audio a la vez 2

Black Forest Labs ha presentado FLUX 3, su nuevo modelo de inteligencia artificial multimodal que aprende de forma conjunta a partir de imágenes, vídeos y audio dentro de una arquitectura unificada. Según la compañía, el lanzamiento tuvo lugar el 23 de julio de 2026 y la primera capacidad disponible —la generación de vídeo con audio nativo— ya está accesible en fase de acceso anticipado (early access). Se trata de uno de los lanzamientos más ambiciosos del estudio alemán, conocido por la familia de modelos FLUX de generación de imágenes.

Qué es FLUX 3 y por qué apuesta por unificar modalidades

De acuerdo con Black Forest Labs, la idea central detrás de FLUX 3 es que las imágenes, los vídeos y el audio son proyecciones del mismo mundo físico, capturadas por sensores distintos. La compañía argumenta que entrenar un modelo con todas esas fuentes a la vez permite que el sistema aprenda más: el sonido debe coincidir con el impacto, el movimiento debe respetar la física y el futuro debe derivarse del pasado.

Según la fuente, este enfoque se diferencia del habitual en la industria, donde los modelos suelen especializarse en una sola modalidad. FLUX 3 combina generación y comprensión en la misma arquitectura, lo que, según BFL, mejora tanto la calidad de los resultados como el rendimiento en tareas derivadas. La arquitectura técnica que lo hace posible se llama Self-Flow, un método propio desarrollado por el equipo investigador del estudio.

Self-Flow, la arquitectura que lo hace posible

Black Forest Labs explica que Self-Flow es su enfoque para alinear generación y comprensión multimodal dentro de un mismo modelo base. Según los datos facilitados, a partir de esta arquitectura la compañía escaló significativamente sus recursos de cómputo y datos para entrenar FLUX 3 con vídeo, imágenes y audio de manera simultánea.

Los resultados preliminares publicados por la empresa muestran mejoras tanto en la generación como en tareas de manipulación robótica. Las métricas internas comparan Self-Flow con el método de Flow Matching estándar, obteniendo menores errores de generación y mayor tasa de éxito en tareas de manipulación física. No obstante, la compañía subraya que se trata de evaluaciones tempranas y que se esperan mejoras adicionales durante la fase de acceso anticipado.

Capacidades de FLUX 3 Video, ya disponible en early access

La primera capacidad abierta al público es FLUX 3 Video, disponible a través de APIs y acceso privado a los pesos del modelo. Según la compañía, el modelo es capaz de generar vídeos de hasta 20 segundos en una sola generación, con audio nativo sincronizado. Los clips de evaluación preliminar se han generado en 720p con audio incluido.

De acuerdo con los datos facilitados, las modalidades de generación de vídeo disponibles incluyen:

  • Texto a vídeo: generación directa desde un prompt escrito.
  • Imagen a vídeo: animación desde un fotograma inicial o usando imágenes como referencia visual.
  • Vídeo a vídeo: transferencia de elementos clave de un clip fuente —como un personaje— a un nuevo contexto.
  • Continuación generativa de vídeo y audio: a partir de un fragmento de vídeo y audio existente.
  • Control por fotogramas clave (keyframe-to-video): para transiciones controladas entre momentos definidos.
  • Encadenamiento multishot: combinación de clips individuales en secuencias más largas con personajes coherentes.

Además, según la fuente, el modelo destaca por su capacidad de generar diálogo multilingüe, una amplia variedad de estilos visuales (desde metraje estilo cámara doméstica hasta animación y cinematografía) y una sólida generación de tipografía animada.

Primeras evaluaciones comparativas frente a otros modelos

Black Forest Labs ha publicado comparativas preliminares de FLUX 3 frente a otros modelos de generación de vídeo del mercado. Según los datos facilitados por la empresa, en evaluaciones de clips de texto a vídeo de 10 segundos a 720p, FLUX 3 fue preferido frente a Runway Gen-4.5 en el 77% de las comparaciones y frente a Luma Ray 3.2 en el 93% de los casos.

Respecto a otros competidores, de acuerdo con la compañía, el modelo fue preferido sobre Grok Imagine Video en hasta el 69% de las comparaciones, sobre Kling v3 Pro en el 60%, sobre Happy Horse v1 en el 59%, sobre Happy Horse 1.1 en el 57%, y sobre Seedance 2.0 y Gemini Omni Flash en el 52%. La empresa insiste en que estos datos son preliminares y que el modelo sigue en desarrollo activo.

FLUX 3 Image, acción robótica y pesos abiertos: el plan de lanzamiento por fases

Según la fuente, Black Forest Labs tiene previsto desplegar las capacidades de FLUX 3 en fases sucesivas a lo largo de las próximas semanas y meses. Todas ellas se construyen sobre el mismo modelo base de flow matching multimodal, aunque se publican de forma independiente tras pasar por periodos de acceso anticipado para recoger feedback y completar pruebas de seguridad.

El plan de lanzamiento publicado por la compañía contempla cuatro etapas:

  • FLUX 3 Video: ya disponible en early access, con generación y edición de vídeo y audio vía API.
  • FLUX 3 Image: síntesis y edición de imágenes, prevista para las próximas semanas.
  • FLUX-mimic y FLUX 3 Action: predicción de acciones para robótica, en colaboración con mimic robotics y con aplicación real en Audi.
  • FLUX 3 Dev: acceso abierto a los pesos del modelo multimodal base, orientado a investigadores y desarrolladores.

Robótica y physical AI: FLUX-mimic y su aplicación en Audi

Uno de los aspectos más llamativos del anuncio es la integración de FLUX 3 en aplicaciones de robótica física. Según la compañía, mimic robotics fue uno de los primeros socios en acceder a FLUX 3, y juntos han desarrollado FLUX-mimic, un modelo de acción en vídeo que combina el backbone de FLUX 3 con la especialización de mimic en aprendizaje robótico para manipulación dextra y despliegue en producción.

De acuerdo con los datos facilitados, este desarrollo ya está siendo probado en tareas reales de producción en Audi. Black Forest Labs defiende que la generación de contenido creativo y la inteligencia artificial física comparten la misma base técnica, y que un modelo que entiende cómo se mueve el mundo es también útil para enseñar a un robot cómo manipular objetos.

Para quién está pensado FLUX 3

Según la fuente, FLUX 3 está diseñado para perfiles muy distintos. La compañía menciona explícitamente a creadores de contenido y cineastas, equipos de marketing y diseño, y equipos de robótica e inteligencia artificial física. Para los primeros, el modelo permite generar clips cinemáticos con audio nativo y encadenarlos en secuencias más largas. Para los equipos de marketing, facilita la producción rápida de variantes visuales y diseños con tipografía.

En cuanto a los desarrolladores, la versión de pesos abiertos FLUX 3 Dev está orientada a quienes quieran construir sobre el modelo base para creación de contenido o predicción de acciones. Según la empresa, el acceso anticipado ya está disponible y puede solicitarse directamente a través de su web oficial en bfl.ai.

Qué viene después para Black Forest Labs

De acuerdo con la compañía, el lanzamiento de FLUX 3 es solo el punto de partida. El equipo ya trabaja en la siguiente generación de modelos, con el objetivo declarado de unificar la predicción perceptiva, de acción y de lenguaje en un único modelo integrado. Según BFL, la frontera que abre FLUX 3 abarca desde la edición interactiva de imágenes y vídeo hasta la simulación, el uso de ordenadores y la inteligencia artificial física.

El estudio, con sede en Alemania y presencia también en Estados Unidos, ha confirmado que está contratando en ambos países. Quien quiera explorar FLUX 3 puede solicitar acceso anticipado a través de bfl.ai/models/flux-3, mientras que los detalles técnicos completos sobre Self-Flow y la arquitectura subyacente se publicarán en próximas semanas, según los datos facilitados por la compañía.

Fuente: https://www-veo3.com/flux-3


También podría ser de tu interés:

Deja un comentario