{"id":130469,"date":"2026-03-29T22:15:29","date_gmt":"2026-03-29T20:15:29","guid":{"rendered":"https:\/\/quondos.com\/mag\/?p=130469"},"modified":"2026-03-29T22:15:31","modified_gmt":"2026-03-29T20:15:31","slug":"meta-presenta-tribe-v2-su-modelo-de-ia-para-predecir-como-responde-el-cerebro-a-imagenes-sonido-y-lenguaje","status":"publish","type":"post","link":"https:\/\/quondos.com\/mag\/meta-presenta-tribe-v2-su-modelo-de-ia-para-predecir-como-responde-el-cerebro-a-imagenes-sonido-y-lenguaje\/","title":{"rendered":"Meta presenta TRIBE v2, su modelo de IA para predecir c\u00f3mo responde el cerebro a im\u00e1genes, sonido y lenguaje"},"content":{"rendered":"\n<figure class=\"wp-block-image size-full\"><img loading=\"lazy\" decoding=\"async\" width=\"900\" height=\"500\" src=\"https:\/\/quondos.com\/mag\/wp-content\/uploads\/2023\/08\/The-Latest-Innovations-That-Meta-Has-Come-Up-with-in-2022-1.jpg\" alt=\"\" class=\"wp-image-125209\" title=\"\" srcset=\"https:\/\/quondos.com\/mag\/wp-content\/uploads\/2023\/08\/The-Latest-Innovations-That-Meta-Has-Come-Up-with-in-2022-1.jpg 900w, https:\/\/quondos.com\/mag\/wp-content\/uploads\/2023\/08\/The-Latest-Innovations-That-Meta-Has-Come-Up-with-in-2022-1-300x167.jpg 300w, https:\/\/quondos.com\/mag\/wp-content\/uploads\/2023\/08\/The-Latest-Innovations-That-Meta-Has-Come-Up-with-in-2022-1-768x427.jpg 768w\" sizes=\"auto, (max-width: 900px) 100vw, 900px\" \/><\/figure>\n\n\n\n<p><strong>Meta ha presentado TRIBE v2<\/strong>, un nuevo modelo de inteligencia artificial orientado a la llamada <strong>neurociencia in silico<\/strong>, es decir, al estudio computacional de c\u00f3mo responde el cerebro humano ante distintos est\u00edmulos. Seg\u00fan la compa\u00f1\u00eda, esta tecnolog\u00eda est\u00e1 dise\u00f1ada para anticipar se\u00f1ales cerebrales medidas con resonancia magn\u00e9tica funcional a partir de v\u00eddeo, audio y lenguaje, con la idea de ofrecer una base m\u00e1s unificada para investigar la cognici\u00f3n humana.<\/p> <div id=\"ez-toc-container\" class=\"ez-toc-v2_0_76 counter-hierarchy ez-toc-counter ez-toc-grey ez-toc-container-direction\">\n<div class=\"ez-toc-title-container\">\n<p class=\"ez-toc-title\" style=\"cursor:inherit\">\u00cdndice de contenidos<\/p>\n<span class=\"ez-toc-title-toggle\"><a href=\"#\" class=\"ez-toc-pull-right ez-toc-btn ez-toc-btn-xs ez-toc-btn-default ez-toc-toggle\" aria-label=\"Alternar tabla de contenidos\"><span class=\"ez-toc-js-icon-con\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Toggle<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #999;color:#999\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewBox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #999;color:#999\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewBox=\"0 0 24 24\" version=\"1.2\" baseProfile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/span><\/a><\/span><\/div>\n<nav><ul class='ez-toc-list ez-toc-list-level-1 ' ><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/quondos.com\/mag\/meta-presenta-tribe-v2-su-modelo-de-ia-para-predecir-como-responde-el-cerebro-a-imagenes-sonido-y-lenguaje\/#Un_modelo_que_intenta_unir_areas_que_hasta_ahora_iban_por_separado\" >Un modelo que intenta unir \u00e1reas que hasta ahora iban por separado<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/quondos.com\/mag\/meta-presenta-tribe-v2-su-modelo-de-ia-para-predecir-como-responde-el-cerebro-a-imagenes-sonido-y-lenguaje\/#Como_funciona_TRIBE_v2_segun_Meta\" >C\u00f3mo funciona TRIBE v2 seg\u00fan Meta<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/quondos.com\/mag\/meta-presenta-tribe-v2-su-modelo-de-ia-para-predecir-como-responde-el-cerebro-a-imagenes-sonido-y-lenguaje\/#Los_datos_de_entrenamiento_y_el_tamano_del_experimento\" >Los datos de entrenamiento y el tama\u00f1o del experimento<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/quondos.com\/mag\/meta-presenta-tribe-v2-su-modelo-de-ia-para-predecir-como-responde-el-cerebro-a-imagenes-sonido-y-lenguaje\/#Que_resultados_destaca_la_compania\" >Qu\u00e9 resultados destaca la compa\u00f1\u00eda<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/quondos.com\/mag\/meta-presenta-tribe-v2-su-modelo-de-ia-para-predecir-como-responde-el-cerebro-a-imagenes-sonido-y-lenguaje\/#Aplicaciones_potenciales_para_la_neurociencia_in_silico\" >Aplicaciones potenciales para la neurociencia in silico<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/quondos.com\/mag\/meta-presenta-tribe-v2-su-modelo-de-ia-para-predecir-como-responde-el-cerebro-a-imagenes-sonido-y-lenguaje\/#Codigo_abierto_pesos_disponibles_y_lo_que_deja_este_anuncio\" >C\u00f3digo abierto, pesos disponibles y lo que deja este anuncio<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"Un_modelo_que_intenta_unir_areas_que_hasta_ahora_iban_por_separado\"><\/span>Un modelo que intenta unir \u00e1reas que hasta ahora iban por separado<span class=\"ez-toc-section-end\"><\/span><\/h2> <p><strong>La propuesta de Meta parte de un problema cl\u00e1sico en neurociencia<\/strong>: muchas investigaciones se han construido con modelos muy concretos para tareas muy concretas. De acuerdo con la fuente, eso ha permitido estudiar con detalle funciones como el reconocimiento de caras, el movimiento o ciertos procesos del lenguaje, pero tambi\u00e9n ha dejado un panorama fragmentado, en el que cuesta integrar visi\u00f3n, audici\u00f3n y comprensi\u00f3n ling\u00fc\u00edstica dentro de un mismo marco.<\/p> <p><strong>TRIBE v2 busca precisamente cubrir ese hueco<\/strong>. Seg\u00fan Meta, se trata de un modelo fundacional trimodal capaz de trabajar con v\u00eddeo, sonido y texto al mismo tiempo para predecir actividad cerebral humana en distintos contextos, tanto en situaciones naturalistas como en experimentos controlados. La relevancia del anuncio est\u00e1 en que apunta a una herramienta com\u00fan para analizar varios tipos de est\u00edmulos con una sola arquitectura, algo que puede interesar tanto a laboratorios como a equipos que trabajan con grandes bases de datos neurocient\u00edficas.<\/p> <h2><span class=\"ez-toc-section\" id=\"Como_funciona_TRIBE_v2_segun_Meta\"><\/span>C\u00f3mo funciona TRIBE v2 seg\u00fan Meta<span class=\"ez-toc-section-end\"><\/span><\/h2> <p><strong>La compa\u00f1\u00eda explica que el sistema no aprende desde cero a \u201cver\u201d o \u201cescuchar\u201d<\/strong>, sino que reutiliza modelos ya avanzados como extractores de caracter\u00edsticas. En texto, emplea <strong>LLaMA 3.2<\/strong>; en v\u00eddeo, recurre a <strong>V-JEPA2<\/strong>; y en audio, utiliza <strong>Wav2Vec-BERT<\/strong>. Despu\u00e9s, esas representaciones se integran dentro de una arquitectura unificada basada en Transformer, que intenta relacionar lo que captan esos modelos con la respuesta cerebral observada.<\/p> <p><strong>Ese dise\u00f1o multimodal permite procesar se\u00f1ales de distinta naturaleza<\/strong> y llevarlas a una representaci\u00f3n com\u00fan. Seg\u00fan la documentaci\u00f3n publicada por Meta y el repositorio abierto en GitHub, el sistema acaba proyectando esas se\u00f1ales sobre la superficie cortical y otras zonas cerebrales para generar predicciones de respuesta en fMRI. La compa\u00f1\u00eda sostiene que esa combinaci\u00f3n abre la puerta a estudiar mejor c\u00f3mo el cerebro integra informaci\u00f3n audiovisual y ling\u00fc\u00edstica en el tiempo, en lugar de analizar cada canal por separado.<\/p> <p><strong>Otro detalle importante es la dimensi\u00f3n temporal<\/strong>. De acuerdo con la fuente, el modelo usa una ventana de contexto amplia para intercambiar informaci\u00f3n entre modalidades y capturar c\u00f3mo evoluciona la actividad cerebral durante varios segundos. Esto encaja con una de las dificultades habituales en neuroimagen: el cerebro no responde a est\u00edmulos aislados como si fueran fotogramas sueltos, sino como secuencias continuas con contexto acumulado.<\/p> <h2><span class=\"ez-toc-section\" id=\"Los_datos_de_entrenamiento_y_el_tamano_del_experimento\"><\/span>Los datos de entrenamiento y el tama\u00f1o del experimento<span class=\"ez-toc-section-end\"><\/span><\/h2> <p><strong>Meta asegura que TRIBE v2 se entren\u00f3 con 451,6 horas de datos de fMRI<\/strong> procedentes de 25 sujetos, repartidos en cuatro estudios naturalistas con pel\u00edculas, p\u00f3dcast y v\u00eddeos sin sonido. Para la evaluaci\u00f3n, seg\u00fan los datos facilitados, el modelo se prob\u00f3 despu\u00e9s en un conjunto mucho m\u00e1s amplio que suma <strong>1.117,7 horas<\/strong> de registros correspondientes a <strong>720 personas<\/strong>.<\/p> <p><strong>Ese contraste entre pocos sujetos con muchas horas de registro y muchos sujetos para validar<\/strong> es una de las claves del trabajo. De acuerdo con la compa\u00f1\u00eda, el objetivo era comprobar si el modelo pod\u00eda generalizar m\u00e1s all\u00e1 del grupo con el que fue entrenado. En otras palabras, no solo importaba que aprendiera patrones de un conjunto concreto, sino que fuera \u00fatil para anticipar respuestas en participantes nuevos y en condiciones distintas.<\/p> <p><strong>Meta tambi\u00e9n afirma haber observado una relaci\u00f3n de escalado log-lineal<\/strong> entre el volumen de datos y la precisi\u00f3n del modelo. Seg\u00fan la fuente, no se detect\u00f3 un techo claro de rendimiento con los datos disponibles. Esa parte del anuncio conecta con una idea cada vez m\u00e1s repetida en IA y ciencia de datos: cuanto m\u00e1s crecen los repositorios y mejor se organizan, m\u00e1s margen hay para que aparezcan mejoras sostenidas en este tipo de sistemas.<\/p> <h2><span class=\"ez-toc-section\" id=\"Que_resultados_destaca_la_compania\"><\/span>Qu\u00e9 resultados destaca la compa\u00f1\u00eda<span class=\"ez-toc-section-end\"><\/span><\/h2> <p><strong>Uno de los puntos que m\u00e1s subraya Meta es la generalizaci\u00f3n zero-shot<\/strong>, es decir, la capacidad de hacer predicciones sobre sujetos no vistos durante el entrenamiento. Seg\u00fan la compa\u00f1\u00eda, TRIBE v2 puede anticipar la respuesta cerebral de personas nuevas sin necesidad de reentrenar el modelo desde cero, algo que, en teor\u00eda, reducir\u00eda parte del coste experimental cuando se trabaja con neuroimagen.<\/p> <p><strong>La fuente tambi\u00e9n se\u00f1ala mejoras frente a modelos lineales cl\u00e1sicos<\/strong> y frente a enfoques basados en FIR, una referencia habitual en codificaci\u00f3n de respuesta cerebral. En el conjunto Human Connectome Project 7T, el equipo indica que TRIBE v2 alcanz\u00f3 una correlaci\u00f3n grupal cercana a 0,4 y mejor\u00f3 de forma notable la capacidad predictiva respecto a la mediana de sujetos individuales. En paralelo, cuando se aporta hasta una hora de datos de un nuevo participante, la compa\u00f1\u00eda asegura que un ajuste fino breve permite mejorar entre dos y cuatro veces frente a modelos lineales entrenados desde cero.<\/p> <ul> <li><strong>Entradas multimodales:<\/strong> v\u00eddeo, audio y lenguaje.<\/li> <li><strong>Modelos base reutilizados:<\/strong> LLaMA 3.2, V-JEPA2 y Wav2Vec-BERT.<\/li> <li><strong>Entrenamiento:<\/strong> 451,6 horas de fMRI en 25 sujetos.<\/li> <li><strong>Evaluaci\u00f3n:<\/strong> 1.117,7 horas en 720 personas.<\/li> <li><strong>Objetivo principal:<\/strong> predecir actividad cerebral en distintos escenarios.<\/li> <\/ul> <h2><span class=\"ez-toc-section\" id=\"Aplicaciones_potenciales_para_la_neurociencia_in_silico\"><\/span>Aplicaciones potenciales para la neurociencia in silico<span class=\"ez-toc-section-end\"><\/span><\/h2> <p><strong>M\u00e1s all\u00e1 del rendimiento t\u00e9cnico, Meta plantea TRIBE v2 como una herramienta para experimentar en ordenador<\/strong> antes de lanzar estudios complejos en laboratorio. Seg\u00fan la fuente, el modelo podr\u00eda servir para pilotar hip\u00f3tesis, preseleccionar dise\u00f1os experimentales o explorar resultados de forma virtual antes de invertir tiempo y recursos en una campa\u00f1a completa de neuroimagen.<\/p> <p><strong>La compa\u00f1\u00eda afirma que, al aplicarlo sobre datos del conjunto Individual Brain Charting<\/strong>, el sistema fue capaz de recuperar referencias funcionales muy conocidas. Entre ellas, menciona \u00e1reas ligadas al reconocimiento de caras y escenas, as\u00ed como regiones relacionadas con procesamiento emocional y sintaxis. Seg\u00fan los datos facilitados, el an\u00e1lisis interno del modelo tambi\u00e9n mostr\u00f3 una organizaci\u00f3n en cinco redes funcionales ampliamente descritas: auditiva primaria, lenguaje, movimiento, modo por defecto y visual.<\/p> <blockquote><strong>Seg\u00fan Meta, la meta de TRIBE v2 no es sustituir los experimentos con personas<\/strong>, sino ofrecer un modelo computacional que ayude a formular, comparar y depurar hip\u00f3tesis sobre la actividad cerebral.<\/blockquote> <h2><span class=\"ez-toc-section\" id=\"Codigo_abierto_pesos_disponibles_y_lo_que_deja_este_anuncio\"><\/span>C\u00f3digo abierto, pesos disponibles y lo que deja este anuncio<span class=\"ez-toc-section-end\"><\/span><\/h2> <p><strong>Meta ha acompa\u00f1ado la publicaci\u00f3n con c\u00f3digo abierto, pesos del modelo y una demo<\/strong>, un movimiento que refuerza el valor pr\u00e1ctico del lanzamiento para la comunidad investigadora. En el repositorio publicado por la compa\u00f1\u00eda, TRIBE v2 aparece como un proyecto para entrenar y evaluar un modelo multimodal de predicci\u00f3n de respuesta cerebral, con soporte para inferencia a partir de v\u00eddeo, audio o texto.<\/p> <p><strong>El anuncio no significa que la neurociencia haya resuelto de golpe el funcionamiento del cerebro<\/strong>, pero s\u00ed apunta a una tendencia clara: cada vez m\u00e1s grupos intentan construir modelos amplios capaces de conectar datos heterog\u00e9neos con hip\u00f3tesis sobre cognici\u00f3n. Seg\u00fan Meta, TRIBE v2 representa un paso hacia esa direcci\u00f3n. Y, en un momento en el que la IA busca salir del texto y entrar en dominios cient\u00edficos m\u00e1s complejos, <strong>la neurociencia computacional aparece como uno de los terrenos donde m\u00e1s puede crecer esta nueva generaci\u00f3n de modelos<\/strong>.<\/p>\n\n\n\n<p>Fuente:https:\/\/ai.meta.com\/research\/publications\/a-foundation-model-of-vision-audition-and-language-for-in-silico-neuroscience<\/p>\n","protected":false},"excerpt":{"rendered":"<p>Meta ha presentado TRIBE v2, un nuevo modelo de inteligencia artificial orientado a la llamada neurociencia in silico, es decir, &#8230; <\/p>\n<p class=\"read-more-container\"><a title=\"Meta presenta TRIBE v2, su modelo de IA para predecir c\u00f3mo responde el cerebro a im\u00e1genes, sonido y lenguaje\" class=\"read-more button\" href=\"https:\/\/quondos.com\/mag\/meta-presenta-tribe-v2-su-modelo-de-ia-para-predecir-como-responde-el-cerebro-a-imagenes-sonido-y-lenguaje\/#more-130469\" aria-label=\"Leer m\u00e1s sobre Meta presenta TRIBE v2, su modelo de IA para predecir c\u00f3mo responde el cerebro a im\u00e1genes, sonido y lenguaje\">Leer m\u00e1s<\/a><\/p>\n","protected":false},"author":850,"featured_media":125209,"comment_status":"open","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[1474],"tags":[],"class_list":["post-130469","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-inteligencia-artificial","generate-columns","tablet-grid-50","mobile-grid-100","grid-parent","grid-50","no-featured-image-padding"],"_links":{"self":[{"href":"https:\/\/quondos.com\/mag\/wp-json\/wp\/v2\/posts\/130469","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/quondos.com\/mag\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/quondos.com\/mag\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/quondos.com\/mag\/wp-json\/wp\/v2\/users\/850"}],"replies":[{"embeddable":true,"href":"https:\/\/quondos.com\/mag\/wp-json\/wp\/v2\/comments?post=130469"}],"version-history":[{"count":2,"href":"https:\/\/quondos.com\/mag\/wp-json\/wp\/v2\/posts\/130469\/revisions"}],"predecessor-version":[{"id":130471,"href":"https:\/\/quondos.com\/mag\/wp-json\/wp\/v2\/posts\/130469\/revisions\/130471"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/quondos.com\/mag\/wp-json\/wp\/v2\/media\/125209"}],"wp:attachment":[{"href":"https:\/\/quondos.com\/mag\/wp-json\/wp\/v2\/media?parent=130469"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/quondos.com\/mag\/wp-json\/wp\/v2\/categories?post=130469"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/quondos.com\/mag\/wp-json\/wp\/v2\/tags?post=130469"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}