{"id":131174,"date":"2026-08-05T22:29:30","date_gmt":"2026-08-05T20:29:30","guid":{"rendered":"https:\/\/quondos.com\/mag\/?p=131174"},"modified":"2026-08-05T22:29:31","modified_gmt":"2026-08-05T20:29:31","slug":"flux-3-el-nuevo-modelo-multimodal-de-black-forest-labs-que-genera-video-imagen-y-audio-a-la-vez","status":"publish","type":"post","link":"https:\/\/quondos.com\/mag\/flux-3-el-nuevo-modelo-multimodal-de-black-forest-labs-que-genera-video-imagen-y-audio-a-la-vez\/","title":{"rendered":"FLUX 3: el nuevo modelo multimodal de Black Forest Labs que genera v\u00eddeo, imagen y audio a la vez"},"content":{"rendered":"\n<figure class=\"wp-block-image size-large\"><img loading=\"lazy\" decoding=\"async\" width=\"1024\" height=\"681\" src=\"https:\/\/quondos.com\/mag\/wp-content\/uploads\/2026\/08\/image-7-1024x681.png\" alt=\"\" class=\"wp-image-131176\" title=\"\" srcset=\"https:\/\/quondos.com\/mag\/wp-content\/uploads\/2026\/08\/image-7-1024x681.png 1024w, https:\/\/quondos.com\/mag\/wp-content\/uploads\/2026\/08\/image-7-300x200.png 300w, https:\/\/quondos.com\/mag\/wp-content\/uploads\/2026\/08\/image-7-768x511.png 768w, https:\/\/quondos.com\/mag\/wp-content\/uploads\/2026\/08\/image-7-1536x1022.png 1536w, https:\/\/quondos.com\/mag\/wp-content\/uploads\/2026\/08\/image-7.png 1900w\" sizes=\"auto, (max-width: 1024px) 100vw, 1024px\" \/><\/figure>\n\n\n\n<p>\n<strong>Black Forest Labs ha presentado FLUX 3<\/strong>, su nuevo modelo de inteligencia artificial multimodal que aprende de forma conjunta a partir de im\u00e1genes, v\u00eddeos y audio dentro de una arquitectura unificada. Seg\u00fan la compa\u00f1\u00eda, el lanzamiento tuvo lugar el <strong>23 de julio de 2026<\/strong> y la primera capacidad disponible \u2014la generaci\u00f3n de v\u00eddeo con audio nativo\u2014 ya est\u00e1 accesible en fase de acceso anticipado (early access). Se trata de uno de los lanzamientos m\u00e1s ambiciosos del estudio alem\u00e1n, conocido por la familia de modelos FLUX de generaci\u00f3n de im\u00e1genes.\n<\/p>\n\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_76 counter-hierarchy ez-toc-counter ez-toc-grey ez-toc-container-direction\">\n<div class=\"ez-toc-title-container\">\n<p class=\"ez-toc-title\" style=\"cursor:inherit\">\u00cdndice de contenidos<\/p>\n<span class=\"ez-toc-title-toggle\"><a href=\"#\" class=\"ez-toc-pull-right ez-toc-btn ez-toc-btn-xs ez-toc-btn-default ez-toc-toggle\" aria-label=\"Alternar tabla de contenidos\"><span class=\"ez-toc-js-icon-con\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Toggle<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #999;color:#999\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewBox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #999;color:#999\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewBox=\"0 0 24 24\" version=\"1.2\" baseProfile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/span><\/a><\/span><\/div>\n<nav><ul class='ez-toc-list ez-toc-list-level-1 ' ><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/quondos.com\/mag\/flux-3-el-nuevo-modelo-multimodal-de-black-forest-labs-que-genera-video-imagen-y-audio-a-la-vez\/#Que_es_FLUX_3_y_por_que_apuesta_por_unificar_modalidades\" >Qu\u00e9 es FLUX 3 y por qu\u00e9 apuesta por unificar modalidades<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/quondos.com\/mag\/flux-3-el-nuevo-modelo-multimodal-de-black-forest-labs-que-genera-video-imagen-y-audio-a-la-vez\/#Self-Flow_la_arquitectura_que_lo_hace_posible\" >Self-Flow, la arquitectura que lo hace posible<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/quondos.com\/mag\/flux-3-el-nuevo-modelo-multimodal-de-black-forest-labs-que-genera-video-imagen-y-audio-a-la-vez\/#Capacidades_de_FLUX_3_Video_ya_disponible_en_early_access\" >Capacidades de FLUX 3 Video, ya disponible en early access<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/quondos.com\/mag\/flux-3-el-nuevo-modelo-multimodal-de-black-forest-labs-que-genera-video-imagen-y-audio-a-la-vez\/#Primeras_evaluaciones_comparativas_frente_a_otros_modelos\" >Primeras evaluaciones comparativas frente a otros modelos<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/quondos.com\/mag\/flux-3-el-nuevo-modelo-multimodal-de-black-forest-labs-que-genera-video-imagen-y-audio-a-la-vez\/#FLUX_3_Image_accion_robotica_y_pesos_abiertos_el_plan_de_lanzamiento_por_fases\" >FLUX 3 Image, acci\u00f3n rob\u00f3tica y pesos abiertos: el plan de lanzamiento por fases<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/quondos.com\/mag\/flux-3-el-nuevo-modelo-multimodal-de-black-forest-labs-que-genera-video-imagen-y-audio-a-la-vez\/#Robotica_y_physical_AI_FLUX-mimic_y_su_aplicacion_en_Audi\" >Rob\u00f3tica y physical AI: FLUX-mimic y su aplicaci\u00f3n en Audi<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/quondos.com\/mag\/flux-3-el-nuevo-modelo-multimodal-de-black-forest-labs-que-genera-video-imagen-y-audio-a-la-vez\/#Para_quien_esta_pensado_FLUX_3\" >Para qui\u00e9n est\u00e1 pensado FLUX 3<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/quondos.com\/mag\/flux-3-el-nuevo-modelo-multimodal-de-black-forest-labs-que-genera-video-imagen-y-audio-a-la-vez\/#Que_viene_despues_para_Black_Forest_Labs\" >Qu\u00e9 viene despu\u00e9s para Black Forest Labs<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"Que_es_FLUX_3_y_por_que_apuesta_por_unificar_modalidades\"><\/span>Qu\u00e9 es FLUX 3 y por qu\u00e9 apuesta por unificar modalidades<span class=\"ez-toc-section-end\"><\/span><\/h2>\n\n<p>\nDe acuerdo con Black Forest Labs, la idea central detr\u00e1s de FLUX 3 es que <strong>las im\u00e1genes, los v\u00eddeos y el audio son proyecciones del mismo mundo f\u00edsico<\/strong>, capturadas por sensores distintos. La compa\u00f1\u00eda argumenta que entrenar un modelo con todas esas fuentes a la vez permite que el sistema aprenda m\u00e1s: el sonido debe coincidir con el impacto, el movimiento debe respetar la f\u00edsica y el futuro debe derivarse del pasado.\n<\/p>\n\n<p>\nSeg\u00fan la fuente, este enfoque se diferencia del habitual en la industria, donde los modelos suelen especializarse en una sola modalidad. <strong>FLUX 3 combina generaci\u00f3n y comprensi\u00f3n en la misma arquitectura<\/strong>, lo que, seg\u00fan BFL, mejora tanto la calidad de los resultados como el rendimiento en tareas derivadas. La arquitectura t\u00e9cnica que lo hace posible se llama <strong>Self-Flow<\/strong>, un m\u00e9todo propio desarrollado por el equipo investigador del estudio.\n<\/p>\n\n<h2><span class=\"ez-toc-section\" id=\"Self-Flow_la_arquitectura_que_lo_hace_posible\"><\/span>Self-Flow, la arquitectura que lo hace posible<span class=\"ez-toc-section-end\"><\/span><\/h2>\n\n<p>\nBlack Forest Labs explica que <strong>Self-Flow es su enfoque para alinear generaci\u00f3n y comprensi\u00f3n multimodal dentro de un mismo modelo base<\/strong>. Seg\u00fan los datos facilitados, a partir de esta arquitectura la compa\u00f1\u00eda escal\u00f3 significativamente sus recursos de c\u00f3mputo y datos para entrenar FLUX 3 con v\u00eddeo, im\u00e1genes y audio de manera simult\u00e1nea.\n<\/p>\n\n<p>\nLos resultados preliminares publicados por la empresa muestran mejoras tanto en la generaci\u00f3n como en tareas de manipulaci\u00f3n rob\u00f3tica. <strong>Las m\u00e9tricas internas comparan Self-Flow con el m\u00e9todo de Flow Matching est\u00e1ndar<\/strong>, obteniendo menores errores de generaci\u00f3n y mayor tasa de \u00e9xito en tareas de manipulaci\u00f3n f\u00edsica. No obstante, la compa\u00f1\u00eda subraya que se trata de evaluaciones tempranas y que se esperan mejoras adicionales durante la fase de acceso anticipado.\n<\/p>\n\n<h2><span class=\"ez-toc-section\" id=\"Capacidades_de_FLUX_3_Video_ya_disponible_en_early_access\"><\/span>Capacidades de FLUX 3 Video, ya disponible en early access<span class=\"ez-toc-section-end\"><\/span><\/h2>\n\n<p>\nLa primera capacidad abierta al p\u00fablico es <strong>FLUX 3 Video<\/strong>, disponible a trav\u00e9s de APIs y acceso privado a los pesos del modelo. Seg\u00fan la compa\u00f1\u00eda, el modelo es capaz de generar v\u00eddeos de hasta <strong>20 segundos en una sola generaci\u00f3n<\/strong>, con audio nativo sincronizado. Los clips de evaluaci\u00f3n preliminar se han generado en 720p con audio incluido.\n<\/p>\n\n<p>\nDe acuerdo con los datos facilitados, las modalidades de generaci\u00f3n de v\u00eddeo disponibles incluyen:\n<\/p>\n\n<ul>\n  <li><strong>Texto a v\u00eddeo<\/strong>: generaci\u00f3n directa desde un prompt escrito.<\/li>\n  <li><strong>Imagen a v\u00eddeo<\/strong>: animaci\u00f3n desde un fotograma inicial o usando im\u00e1genes como referencia visual.<\/li>\n  <li><strong>V\u00eddeo a v\u00eddeo<\/strong>: transferencia de elementos clave de un clip fuente \u2014como un personaje\u2014 a un nuevo contexto.<\/li>\n  <li><strong>Continuaci\u00f3n generativa de v\u00eddeo y audio<\/strong>: a partir de un fragmento de v\u00eddeo y audio existente.<\/li>\n  <li><strong>Control por fotogramas clave<\/strong> (keyframe-to-video): para transiciones controladas entre momentos definidos.<\/li>\n  <li><strong>Encadenamiento multishot<\/strong>: combinaci\u00f3n de clips individuales en secuencias m\u00e1s largas con personajes coherentes.<\/li>\n<\/ul>\n\n<p>\nAdem\u00e1s, seg\u00fan la fuente, el modelo destaca por su capacidad de generar <strong>di\u00e1logo multiling\u00fce<\/strong>, una amplia variedad de estilos visuales (desde metraje estilo c\u00e1mara dom\u00e9stica hasta animaci\u00f3n y cinematograf\u00eda) y una s\u00f3lida generaci\u00f3n de tipograf\u00eda animada.\n<\/p>\n\n<h2><span class=\"ez-toc-section\" id=\"Primeras_evaluaciones_comparativas_frente_a_otros_modelos\"><\/span>Primeras evaluaciones comparativas frente a otros modelos<span class=\"ez-toc-section-end\"><\/span><\/h2>\n\n<p>\nBlack Forest Labs ha publicado comparativas preliminares de FLUX 3 frente a otros modelos de generaci\u00f3n de v\u00eddeo del mercado. Seg\u00fan los datos facilitados por la empresa, en evaluaciones de clips de texto a v\u00eddeo de 10 segundos a 720p, <strong>FLUX 3 fue preferido frente a Runway Gen-4.5 en el 77% de las comparaciones<\/strong> y frente a Luma Ray 3.2 en el 93% de los casos.\n<\/p>\n\n<p>\nRespecto a otros competidores, de acuerdo con la compa\u00f1\u00eda, el modelo fue preferido sobre <strong>Grok Imagine Video en hasta el 69% de las comparaciones<\/strong>, sobre Kling v3 Pro en el 60%, sobre Happy Horse v1 en el 59%, sobre Happy Horse 1.1 en el 57%, y sobre Seedance 2.0 y Gemini Omni Flash en el 52%. La empresa insiste en que <strong>estos datos son preliminares<\/strong> y que el modelo sigue en desarrollo activo.\n<\/p>\n\n<h2><span class=\"ez-toc-section\" id=\"FLUX_3_Image_accion_robotica_y_pesos_abiertos_el_plan_de_lanzamiento_por_fases\"><\/span>FLUX 3 Image, acci\u00f3n rob\u00f3tica y pesos abiertos: el plan de lanzamiento por fases<span class=\"ez-toc-section-end\"><\/span><\/h2>\n\n<p>\nSeg\u00fan la fuente, Black Forest Labs tiene previsto desplegar las capacidades de FLUX 3 en fases sucesivas a lo largo de las pr\u00f3ximas semanas y meses. Todas ellas se construyen sobre el mismo modelo base de flow matching multimodal, aunque se publican de forma independiente tras pasar por periodos de acceso anticipado para recoger feedback y completar pruebas de seguridad.\n<\/p>\n\n<p>\nEl plan de lanzamiento publicado por la compa\u00f1\u00eda contempla cuatro etapas:\n<\/p>\n\n<ul>\n  <li><strong>FLUX 3 Video<\/strong>: ya disponible en early access, con generaci\u00f3n y edici\u00f3n de v\u00eddeo y audio v\u00eda API.<\/li>\n  <li><strong>FLUX 3 Image<\/strong>: s\u00edntesis y edici\u00f3n de im\u00e1genes, prevista para las pr\u00f3ximas semanas.<\/li>\n  <li><strong>FLUX-mimic y FLUX 3 Action<\/strong>: predicci\u00f3n de acciones para rob\u00f3tica, en colaboraci\u00f3n con mimic robotics y con aplicaci\u00f3n real en Audi.<\/li>\n  <li><strong>FLUX 3 Dev<\/strong>: acceso abierto a los pesos del modelo multimodal base, orientado a investigadores y desarrolladores.<\/li>\n<\/ul>\n\n<h2><span class=\"ez-toc-section\" id=\"Robotica_y_physical_AI_FLUX-mimic_y_su_aplicacion_en_Audi\"><\/span>Rob\u00f3tica y physical AI: FLUX-mimic y su aplicaci\u00f3n en Audi<span class=\"ez-toc-section-end\"><\/span><\/h2>\n\n<p>\nUno de los aspectos m\u00e1s llamativos del anuncio es la integraci\u00f3n de FLUX 3 en aplicaciones de rob\u00f3tica f\u00edsica. Seg\u00fan la compa\u00f1\u00eda, <strong>mimic robotics fue uno de los primeros socios en acceder a FLUX 3<\/strong>, y juntos han desarrollado FLUX-mimic, un modelo de acci\u00f3n en v\u00eddeo que combina el backbone de FLUX 3 con la especializaci\u00f3n de mimic en aprendizaje rob\u00f3tico para manipulaci\u00f3n dextra y despliegue en producci\u00f3n.\n<\/p>\n\n<p>\nDe acuerdo con los datos facilitados, <strong>este desarrollo ya est\u00e1 siendo probado en tareas reales de producci\u00f3n en Audi<\/strong>. Black Forest Labs defiende que la generaci\u00f3n de contenido creativo y la inteligencia artificial f\u00edsica comparten la misma base t\u00e9cnica, y que un modelo que entiende c\u00f3mo se mueve el mundo es tambi\u00e9n \u00fatil para ense\u00f1ar a un robot c\u00f3mo manipular objetos.\n<\/p>\n\n<h2><span class=\"ez-toc-section\" id=\"Para_quien_esta_pensado_FLUX_3\"><\/span>Para qui\u00e9n est\u00e1 pensado FLUX 3<span class=\"ez-toc-section-end\"><\/span><\/h2>\n\n<p>\nSeg\u00fan la fuente, FLUX 3 est\u00e1 dise\u00f1ado para perfiles muy distintos. La compa\u00f1\u00eda menciona expl\u00edcitamente a <strong>creadores de contenido y cineastas<\/strong>, equipos de marketing y dise\u00f1o, y equipos de rob\u00f3tica e inteligencia artificial f\u00edsica. Para los primeros, el modelo permite generar clips cinem\u00e1ticos con audio nativo y encadenarlos en secuencias m\u00e1s largas. Para los equipos de marketing, facilita la producci\u00f3n r\u00e1pida de variantes visuales y dise\u00f1os con tipograf\u00eda.\n<\/p>\n\n<p>\nEn cuanto a los desarrolladores, <strong>la versi\u00f3n de pesos abiertos FLUX 3 Dev<\/strong> est\u00e1 orientada a quienes quieran construir sobre el modelo base para creaci\u00f3n de contenido o predicci\u00f3n de acciones. Seg\u00fan la empresa, el acceso anticipado ya est\u00e1 disponible y puede solicitarse directamente a trav\u00e9s de su web oficial en bfl.ai.\n<\/p>\n\n<h2><span class=\"ez-toc-section\" id=\"Que_viene_despues_para_Black_Forest_Labs\"><\/span>Qu\u00e9 viene despu\u00e9s para Black Forest Labs<span class=\"ez-toc-section-end\"><\/span><\/h2>\n\n<p>\nDe acuerdo con la compa\u00f1\u00eda, el lanzamiento de FLUX 3 es solo el punto de partida. <strong>El equipo ya trabaja en la siguiente generaci\u00f3n de modelos<\/strong>, con el objetivo declarado de unificar la predicci\u00f3n perceptiva, de acci\u00f3n y de lenguaje en un \u00fanico modelo integrado. Seg\u00fan BFL, la frontera que abre FLUX 3 abarca desde la edici\u00f3n interactiva de im\u00e1genes y v\u00eddeo hasta la simulaci\u00f3n, el uso de ordenadores y la inteligencia artificial f\u00edsica.\n<\/p>\n\n<p>\nEl estudio, con sede en Alemania y presencia tambi\u00e9n en Estados Unidos, <strong>ha confirmado que est\u00e1 contratando en ambos pa\u00edses<\/strong>. Quien quiera explorar FLUX 3 puede solicitar acceso anticipado a trav\u00e9s de bfl.ai\/models\/flux-3, mientras que los detalles t\u00e9cnicos completos sobre Self-Flow y la arquitectura subyacente se publicar\u00e1n en pr\u00f3ximas semanas, seg\u00fan los datos facilitados por la compa\u00f1\u00eda.\n<\/p>\n\n\n\n<p>Fuente: https:\/\/www-veo3.com\/flux-3<\/p>\n","protected":false},"excerpt":{"rendered":"<p>Black Forest Labs ha presentado FLUX 3, su nuevo modelo de inteligencia artificial multimodal que aprende de forma conjunta a &#8230; <\/p>\n<p class=\"read-more-container\"><a title=\"FLUX 3: el nuevo modelo multimodal de Black Forest Labs que genera v\u00eddeo, imagen y audio a la vez\" class=\"read-more button\" href=\"https:\/\/quondos.com\/mag\/flux-3-el-nuevo-modelo-multimodal-de-black-forest-labs-que-genera-video-imagen-y-audio-a-la-vez\/#more-131174\" aria-label=\"Leer m\u00e1s sobre FLUX 3: el nuevo modelo multimodal de Black Forest Labs que genera v\u00eddeo, imagen y audio a la vez\">Leer m\u00e1s<\/a><\/p>\n","protected":false},"author":850,"featured_media":131176,"comment_status":"open","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[1474],"tags":[],"class_list":["post-131174","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-inteligencia-artificial","generate-columns","tablet-grid-50","mobile-grid-100","grid-parent","grid-50","no-featured-image-padding"],"_links":{"self":[{"href":"https:\/\/quondos.com\/mag\/wp-json\/wp\/v2\/posts\/131174","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/quondos.com\/mag\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/quondos.com\/mag\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/quondos.com\/mag\/wp-json\/wp\/v2\/users\/850"}],"replies":[{"embeddable":true,"href":"https:\/\/quondos.com\/mag\/wp-json\/wp\/v2\/comments?post=131174"}],"version-history":[{"count":1,"href":"https:\/\/quondos.com\/mag\/wp-json\/wp\/v2\/posts\/131174\/revisions"}],"predecessor-version":[{"id":131177,"href":"https:\/\/quondos.com\/mag\/wp-json\/wp\/v2\/posts\/131174\/revisions\/131177"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/quondos.com\/mag\/wp-json\/wp\/v2\/media\/131176"}],"wp:attachment":[{"href":"https:\/\/quondos.com\/mag\/wp-json\/wp\/v2\/media?parent=131174"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/quondos.com\/mag\/wp-json\/wp\/v2\/categories?post=131174"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/quondos.com\/mag\/wp-json\/wp\/v2\/tags?post=131174"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}