{"id":131270,"date":"2026-09-02T23:43:33","date_gmt":"2026-09-02T21:43:33","guid":{"rendered":"https:\/\/quondos.com\/mag\/?p=131270"},"modified":"2026-09-02T23:43:35","modified_gmt":"2026-09-02T21:43:35","slug":"meta-presenta-muse-voice-transcribe-su-modelo-de-ia-que-transcribe-conversaciones-en-tiempo-real-y-distingue-a-mas-de-20-personas","status":"publish","type":"post","link":"https:\/\/quondos.com\/mag\/meta-presenta-muse-voice-transcribe-su-modelo-de-ia-que-transcribe-conversaciones-en-tiempo-real-y-distingue-a-mas-de-20-personas\/","title":{"rendered":"Meta presenta Muse Voice Transcribe, su modelo de IA que transcribe conversaciones en tiempo real y distingue a m\u00e1s de 20 personas"},"content":{"rendered":"\n<figure class=\"wp-block-image size-large\"><img loading=\"lazy\" decoding=\"async\" width=\"1024\" height=\"576\" src=\"https:\/\/quondos.com\/mag\/wp-content\/uploads\/2026\/09\/image-7-1024x576.png\" alt=\"\" class=\"wp-image-131272\" title=\"\" srcset=\"https:\/\/quondos.com\/mag\/wp-content\/uploads\/2026\/09\/image-7-1024x576.png 1024w, https:\/\/quondos.com\/mag\/wp-content\/uploads\/2026\/09\/image-7-300x169.png 300w, https:\/\/quondos.com\/mag\/wp-content\/uploads\/2026\/09\/image-7-768x432.png 768w, https:\/\/quondos.com\/mag\/wp-content\/uploads\/2026\/09\/image-7-1536x864.png 1536w, https:\/\/quondos.com\/mag\/wp-content\/uploads\/2026\/09\/image-7.png 1600w\" sizes=\"auto, (max-width: 1024px) 100vw, 1024px\" \/><\/figure>\n\n\n\n<p><strong>Meta ha presentado Muse Voice Transcribe<\/strong>, un nuevo modelo de inteligencia artificial dise\u00f1ado para convertir conversaciones de voz en texto en tiempo real. Seg\u00fan la compa\u00f1\u00eda, se trata del primer modelo de percepci\u00f3n de audio en tiempo real desarrollado por <strong>Meta Superintelligence Labs<\/strong> y combina transcripci\u00f3n, identificaci\u00f3n de interlocutores y detecci\u00f3n del final de cada intervenci\u00f3n.<\/p> <p>La propuesta busca ir m\u00e1s all\u00e1 de la cl\u00e1sica transcripci\u00f3n de voz. De acuerdo con Meta, Muse Voice Transcribe puede trabajar con <strong>m\u00e1s de 25 idiomas<\/strong>, reconocer cambios de idioma dentro de una misma conversaci\u00f3n y utilizar palabras clave y contexto para mejorar la precisi\u00f3n. La compa\u00f1\u00eda tambi\u00e9n asegura que el modelo ocupa el primer puesto en Artificial Analysis en streaming speech-to-text y en benchmarks p\u00fablicos de diarizaci\u00f3n, seg\u00fan sus datos del 1 de septiembre de 2026.<\/p> <div id=\"ez-toc-container\" class=\"ez-toc-v2_0_76 counter-hierarchy ez-toc-counter ez-toc-grey ez-toc-container-direction\">\n<div class=\"ez-toc-title-container\">\n<p class=\"ez-toc-title\" style=\"cursor:inherit\">\u00cdndice de contenidos<\/p>\n<span class=\"ez-toc-title-toggle\"><a href=\"#\" class=\"ez-toc-pull-right ez-toc-btn ez-toc-btn-xs ez-toc-btn-default ez-toc-toggle\" aria-label=\"Alternar tabla de contenidos\"><span class=\"ez-toc-js-icon-con\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Toggle<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #999;color:#999\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewBox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #999;color:#999\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewBox=\"0 0 24 24\" version=\"1.2\" baseProfile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/span><\/a><\/span><\/div>\n<nav><ul class='ez-toc-list ez-toc-list-level-1 ' ><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/quondos.com\/mag\/meta-presenta-muse-voice-transcribe-su-modelo-de-ia-que-transcribe-conversaciones-en-tiempo-real-y-distingue-a-mas-de-20-personas\/#Un_modelo_pensado_para_entender_conversaciones_mientras_ocurren\" >Un modelo pensado para entender conversaciones mientras ocurren<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/quondos.com\/mag\/meta-presenta-muse-voice-transcribe-su-modelo-de-ia-que-transcribe-conversaciones-en-tiempo-real-y-distingue-a-mas-de-20-personas\/#La_velocidad_se_ajusta_segun_la_dificultad_de_cada_palabra\" >La velocidad se ajusta seg\u00fan la dificultad de cada palabra<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/quondos.com\/mag\/meta-presenta-muse-voice-transcribe-su-modelo-de-ia-que-transcribe-conversaciones-en-tiempo-real-y-distingue-a-mas-de-20-personas\/#Mas_de_25_idiomas_y_cambios_de_lengua_dentro_de_una_frase\" >M\u00e1s de 25 idiomas y cambios de lengua dentro de una frase<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/quondos.com\/mag\/meta-presenta-muse-voice-transcribe-su-modelo-de-ia-que-transcribe-conversaciones-en-tiempo-real-y-distingue-a-mas-de-20-personas\/#El_contexto_tambien_sirve_para_mejorar_la_transcripcion\" >El contexto tambi\u00e9n sirve para mejorar la transcripci\u00f3n<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/quondos.com\/mag\/meta-presenta-muse-voice-transcribe-su-modelo-de-ia-que-transcribe-conversaciones-en-tiempo-real-y-distingue-a-mas-de-20-personas\/#Tambien_puede_trabajar_con_conversaciones_de_mas_de_una_hora\" >Tambi\u00e9n puede trabajar con conversaciones de m\u00e1s de una hora<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/quondos.com\/mag\/meta-presenta-muse-voice-transcribe-su-modelo-de-ia-que-transcribe-conversaciones-en-tiempo-real-y-distingue-a-mas-de-20-personas\/#Meta_quiere_que_la_voz_sea_una_pieza_de_sus_futuros_agentes_de_IA\" >Meta quiere que la voz sea una pieza de sus futuros agentes de IA<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/quondos.com\/mag\/meta-presenta-muse-voice-transcribe-su-modelo-de-ia-que-transcribe-conversaciones-en-tiempo-real-y-distingue-a-mas-de-20-personas\/#Una_primera_pieza_para_la_estrategia_de_Meta_Superintelligence_Labs\" >Una primera pieza para la estrategia de Meta Superintelligence Labs<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"Un_modelo_pensado_para_entender_conversaciones_mientras_ocurren\"><\/span>Un modelo pensado para entender conversaciones mientras ocurren<span class=\"ez-toc-section-end\"><\/span><\/h2> <p>Uno de los puntos centrales de Muse Voice Transcribe es su capacidad de realizar <strong>streaming ASR, diarizaci\u00f3n y endpointing<\/strong> de forma simult\u00e1nea. En t\u00e9rminos sencillos, el sistema no espera necesariamente a que termine una conversaci\u00f3n completa para generar la transcripci\u00f3n, sino que procesa el audio mientras las personas hablan.<\/p> <p>La diarizaci\u00f3n permite adem\u00e1s identificar <strong>qui\u00e9n est\u00e1 hablando en cada momento<\/strong>. Meta muestra una demostraci\u00f3n con ocho personas conversando en una misma sala y el sistema asigna diferentes etiquetas a los participantes. Seg\u00fan la compa\u00f1\u00eda, esta funci\u00f3n resulta especialmente relevante en conversaciones reales, donde pueden producirse interrupciones, solapamientos y cambios r\u00e1pidos entre interlocutores.<\/p> <p>El modelo tambi\u00e9n incorpora lo que Meta denomina <strong>endpointing<\/strong>, una tecnolog\u00eda destinada a detectar cu\u00e1ndo comienza y cu\u00e1ndo termina una intervenci\u00f3n de voz. Esto puede resultar importante en aplicaciones conversacionales, ya que permite distinguir entre una pausa dentro de una frase y el momento en el que una persona realmente ha terminado de hablar.<\/p> <h2><span class=\"ez-toc-section\" id=\"La_velocidad_se_ajusta_segun_la_dificultad_de_cada_palabra\"><\/span>La velocidad se ajusta seg\u00fan la dificultad de cada palabra<span class=\"ez-toc-section-end\"><\/span><\/h2> <p>Muse Voice Transcribe pertenece a la familia <strong>Muse Spark<\/strong> y est\u00e1 construido como un modelo multimodal autorregresivo. Seg\u00fan explica Meta, el audio se procesa en fragmentos de 80 milisegundos, y el sistema decide continuamente si necesita seguir escuchando o si ya dispone de suficiente informaci\u00f3n para producir texto.<\/p> <p>Esta arquitectura introduce un equilibrio entre <strong>precisi\u00f3n y latencia<\/strong>. Si el modelo espera m\u00e1s contexto antes de transcribir una palabra, puede aumentar la precisi\u00f3n, pero tambi\u00e9n tarda m\u00e1s en mostrar el resultado. Para solucionar este problema, Meta ha desarrollado un sistema de \u201cadaptive delay\u201d, que modifica din\u00e1micamente el tiempo de espera dependiendo de la dificultad de cada palabra.<\/p> <p>Seg\u00fan la explicaci\u00f3n t\u00e9cnica publicada por la compa\u00f1\u00eda, este comportamiento se ha entrenado mediante <strong>reinforcement learning<\/strong>, combinando recompensas relacionadas con la tasa de errores de palabras y con el retraso de la transcripci\u00f3n. Meta afirma que este sistema permite situar a Muse Voice Transcribe en una posici\u00f3n favorable dentro del equilibrio entre velocidad y precisi\u00f3n.<\/p> <h2><span class=\"ez-toc-section\" id=\"Mas_de_25_idiomas_y_cambios_de_lengua_dentro_de_una_frase\"><\/span>M\u00e1s de 25 idiomas y cambios de lengua dentro de una frase<span class=\"ez-toc-section-end\"><\/span><\/h2> <p>El apartado multiling\u00fce es otro de los elementos destacados por Meta. Muse Voice Transcribe ha sido entrenado con <strong>m\u00e1s de 70 idiomas<\/strong>, aunque la compa\u00f1\u00eda se\u00f1ala que 25 de ellos han sido verificados de forma exhaustiva y son los que recomienda probar en el lanzamiento inicial.<\/p> <p>Entre los idiomas que aparecen en las demostraciones est\u00e1n <strong>chino, franc\u00e9s, hindi, japon\u00e9s, espa\u00f1ol y vietnamita<\/strong>. La compa\u00f1\u00eda indica que existe soporte adicional para otros idiomas, aunque la lista de 25 lenguas validadas constituye la referencia principal para comprobar las capacidades del modelo en esta primera versi\u00f3n.<\/p> <p>Una caracter\u00edstica especialmente interesante es el <strong>code-switching<\/strong>, es decir, la posibilidad de cambiar de idioma durante una misma conversaci\u00f3n. Meta asegura que Muse puede reconocer estos cambios tanto entre frases como dentro de una misma frase, algo habitual entre personas biling\u00fces que mezclan idiomas de manera natural.<\/p> <blockquote><p>Seg\u00fan Meta, esta capacidad permite que una conversaci\u00f3n pueda mezclar diferentes idiomas sin que el usuario tenga que cambiar manualmente la configuraci\u00f3n del sistema.<\/p><\/blockquote> <p>La compa\u00f1\u00eda acompa\u00f1a esta funci\u00f3n con una demostraci\u00f3n en la que se mezclan <strong>mandar\u00edn e ingl\u00e9s<\/strong> dentro de una conversaci\u00f3n t\u00e9cnica. El objetivo es mostrar que el sistema no solo identifica los idiomas, sino que puede mantener la transcripci\u00f3n cuando el hablante cambia de lengua de forma espont\u00e1nea.<\/p> <h2><span class=\"ez-toc-section\" id=\"El_contexto_tambien_sirve_para_mejorar_la_transcripcion\"><\/span>El contexto tambi\u00e9n sirve para mejorar la transcripci\u00f3n<span class=\"ez-toc-section-end\"><\/span><\/h2> <p>Muse Voice Transcribe incorpora adem\u00e1s <strong>context biasing<\/strong>, una t\u00e9cnica que permite utilizar informaci\u00f3n contextual para mejorar el reconocimiento de determinadas palabras. Seg\u00fan Meta, esto puede ayudar especialmente cuando aparecen nombres propios, lugares, contactos o t\u00e9rminos que pueden resultar dif\u00edciles de identificar \u00fanicamente a partir del sonido.<\/p> <p>En la demostraci\u00f3n de la compa\u00f1\u00eda aparecen t\u00e9rminos como <strong>Meta, Muse y Menlo Park<\/strong>. La idea, de acuerdo con Meta, es que un sistema de voz destinado a convertirse en una herramienta personal pueda reconocer mejor las palabras que forman parte del contexto habitual de cada usuario.<\/p> <p>Esta caracter\u00edstica adquiere especial importancia cuando se piensa en asistentes de IA que deben desenvolverse en conversaciones naturales. Una transcripci\u00f3n puede ser correcta en t\u00e9rminos generales y, aun as\u00ed, equivocarse precisamente en <strong>nombres, marcas o palabras poco frecuentes<\/strong>. El contexto busca reducir ese tipo de errores.<\/p> <h2><span class=\"ez-toc-section\" id=\"Tambien_puede_trabajar_con_conversaciones_de_mas_de_una_hora\"><\/span>Tambi\u00e9n puede trabajar con conversaciones de m\u00e1s de una hora<span class=\"ez-toc-section-end\"><\/span><\/h2> <p>La capacidad del modelo no se limita a fragmentos cortos de audio. Meta afirma que Muse Voice Transcribe admite <strong>entradas de audio de m\u00e1s de una hora<\/strong> y puede trabajar con m\u00e1s de 20 interlocutores sin necesidad de aplicar un procesamiento posterior para separar las voces.<\/p> <p>Para demostrarlo, la compa\u00f1\u00eda ofrece una grabaci\u00f3n de aproximadamente <strong>una hora y un minuto<\/strong> en la que intervienen m\u00faltiples personas. En ella, el sistema identifica a los participantes mediante etiquetas y mantiene la separaci\u00f3n de los distintos hablantes a lo largo de la conversaci\u00f3n.<\/p> <p>Esta posibilidad puede ser relevante para escenarios como <strong>reuniones, entrevistas, conversaciones de grupo o grabaciones extensas<\/strong>. La principal diferencia respecto a una transcripci\u00f3n convencional estar\u00eda en que el sistema intenta resolver durante el propio proceso tanto el texto como qui\u00e9n ha pronunciado cada intervenci\u00f3n.<\/p> <h2><span class=\"ez-toc-section\" id=\"Meta_quiere_que_la_voz_sea_una_pieza_de_sus_futuros_agentes_de_IA\"><\/span>Meta quiere que la voz sea una pieza de sus futuros agentes de IA<span class=\"ez-toc-section-end\"><\/span><\/h2> <p>La presentaci\u00f3n de Muse Voice Transcribe encaja, seg\u00fan el planteamiento de Meta, en una visi\u00f3n m\u00e1s amplia de los <strong>agentes personales de inteligencia artificial<\/strong>. La compa\u00f1\u00eda sostiene que estos sistemas necesitan capacidades de percepci\u00f3n capaces de entender conversaciones reales y no limitarse a responder a comandos de voz perfectamente estructurados.<\/p> <p>En el material publicado por Meta se relaciona esta tecnolog\u00eda con dispositivos como las <strong>gafas con IA<\/strong>, donde comprender una conversaci\u00f3n mientras ocurre puede ser una capacidad importante. La compa\u00f1\u00eda plantea que un asistente verdaderamente personal necesita poder escuchar, distinguir interlocutores y entender diferentes idiomas sin obligar al usuario a adaptar su forma de hablar.<\/p> <p>Meta tambi\u00e9n presenta el reconocimiento de voz como una tecnolog\u00eda que puede servir para algo m\u00e1s que <strong>automatizar tareas<\/strong>. Seg\u00fan la fuente, una mejor comprensi\u00f3n del audio podr\u00eda utilizarse para crear, expresar ideas o aprender, convirtiendo la percepci\u00f3n de voz en una parte fundamental de futuras herramientas de IA.<\/p> <h2><span class=\"ez-toc-section\" id=\"Una_primera_pieza_para_la_estrategia_de_Meta_Superintelligence_Labs\"><\/span>Una primera pieza para la estrategia de Meta Superintelligence Labs<span class=\"ez-toc-section-end\"><\/span><\/h2> <p>La compa\u00f1\u00eda define Muse Voice Transcribe como un <strong>primer hito de sus modelos de voz en tiempo real<\/strong>. El lanzamiento llega dentro de Meta Superintelligence Labs, la divisi\u00f3n que la empresa est\u00e1 utilizando para desarrollar sus pr\u00f3ximos sistemas avanzados de inteligencia artificial.<\/p> <p>Por ahora, Meta centra la presentaci\u00f3n en las capacidades de percepci\u00f3n y en las demostraciones t\u00e9cnicas del modelo. La compa\u00f1\u00eda destaca especialmente la combinaci\u00f3n de <strong>baja latencia, transcripci\u00f3n multiling\u00fce, diarizaci\u00f3n y comprensi\u00f3n contextual<\/strong>, cuatro elementos que pueden resultar importantes para construir sistemas capaces de interactuar con personas en conversaciones m\u00e1s naturales.<\/p> <p>La propia demostraci\u00f3n deja claro que el objetivo no es \u00fanicamente conseguir que una m\u00e1quina convierta audio en texto. Seg\u00fan Meta, el siguiente paso consiste en que los sistemas puedan <strong>escuchar una conversaci\u00f3n completa, saber qui\u00e9n habla y comprender el contexto<\/strong> mientras todo sucede en tiempo real. Muse Voice Transcribe es, de acuerdo con la compa\u00f1\u00eda, una de las primeras piezas de esa estrategia.<\/p>\n\n\n\n<p>Fuente: https:\/\/research.meta.ai\/blog\/introducing-muse-voice-transcribe<\/p>\n","protected":false},"excerpt":{"rendered":"<p>Meta ha presentado Muse Voice Transcribe, un nuevo modelo de inteligencia artificial dise\u00f1ado para convertir conversaciones de voz en texto &#8230; <\/p>\n<p class=\"read-more-container\"><a title=\"Meta presenta Muse Voice Transcribe, su modelo de IA que transcribe conversaciones en tiempo real y distingue a m\u00e1s de 20 personas\" class=\"read-more button\" href=\"https:\/\/quondos.com\/mag\/meta-presenta-muse-voice-transcribe-su-modelo-de-ia-que-transcribe-conversaciones-en-tiempo-real-y-distingue-a-mas-de-20-personas\/#more-131270\" aria-label=\"Leer m\u00e1s sobre Meta presenta Muse Voice Transcribe, su modelo de IA que transcribe conversaciones en tiempo real y distingue a m\u00e1s de 20 personas\">Leer m\u00e1s<\/a><\/p>\n","protected":false},"author":850,"featured_media":131272,"comment_status":"open","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[1474],"tags":[],"class_list":["post-131270","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-inteligencia-artificial","generate-columns","tablet-grid-50","mobile-grid-100","grid-parent","grid-50","no-featured-image-padding"],"_links":{"self":[{"href":"https:\/\/quondos.com\/mag\/wp-json\/wp\/v2\/posts\/131270","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/quondos.com\/mag\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/quondos.com\/mag\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/quondos.com\/mag\/wp-json\/wp\/v2\/users\/850"}],"replies":[{"embeddable":true,"href":"https:\/\/quondos.com\/mag\/wp-json\/wp\/v2\/comments?post=131270"}],"version-history":[{"count":1,"href":"https:\/\/quondos.com\/mag\/wp-json\/wp\/v2\/posts\/131270\/revisions"}],"predecessor-version":[{"id":131273,"href":"https:\/\/quondos.com\/mag\/wp-json\/wp\/v2\/posts\/131270\/revisions\/131273"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/quondos.com\/mag\/wp-json\/wp\/v2\/media\/131272"}],"wp:attachment":[{"href":"https:\/\/quondos.com\/mag\/wp-json\/wp\/v2\/media?parent=131270"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/quondos.com\/mag\/wp-json\/wp\/v2\/categories?post=131270"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/quondos.com\/mag\/wp-json\/wp\/v2\/tags?post=131270"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}