Meta presenta Muse Voice Transcribe, su modelo de IA que transcribe conversaciones en tiempo real y distingue a más de 20 personas

Meta presenta Muse Voice Transcribe, su modelo de IA que transcribe conversaciones en tiempo real y distingue a más de 20 personas 2

Meta ha presentado Muse Voice Transcribe, un nuevo modelo de inteligencia artificial diseñado para convertir conversaciones de voz en texto en tiempo real. Según la compañía, se trata del primer modelo de percepción de audio en tiempo real desarrollado por Meta Superintelligence Labs y combina transcripción, identificación de interlocutores y detección del final de cada intervención.

La propuesta busca ir más allá de la clásica transcripción de voz. De acuerdo con Meta, Muse Voice Transcribe puede trabajar con más de 25 idiomas, reconocer cambios de idioma dentro de una misma conversación y utilizar palabras clave y contexto para mejorar la precisión. La compañía también asegura que el modelo ocupa el primer puesto en Artificial Analysis en streaming speech-to-text y en benchmarks públicos de diarización, según sus datos del 1 de septiembre de 2026.

Un modelo pensado para entender conversaciones mientras ocurren

Uno de los puntos centrales de Muse Voice Transcribe es su capacidad de realizar streaming ASR, diarización y endpointing de forma simultánea. En términos sencillos, el sistema no espera necesariamente a que termine una conversación completa para generar la transcripción, sino que procesa el audio mientras las personas hablan.

La diarización permite además identificar quién está hablando en cada momento. Meta muestra una demostración con ocho personas conversando en una misma sala y el sistema asigna diferentes etiquetas a los participantes. Según la compañía, esta función resulta especialmente relevante en conversaciones reales, donde pueden producirse interrupciones, solapamientos y cambios rápidos entre interlocutores.

El modelo también incorpora lo que Meta denomina endpointing, una tecnología destinada a detectar cuándo comienza y cuándo termina una intervención de voz. Esto puede resultar importante en aplicaciones conversacionales, ya que permite distinguir entre una pausa dentro de una frase y el momento en el que una persona realmente ha terminado de hablar.

La velocidad se ajusta según la dificultad de cada palabra

Muse Voice Transcribe pertenece a la familia Muse Spark y está construido como un modelo multimodal autorregresivo. Según explica Meta, el audio se procesa en fragmentos de 80 milisegundos, y el sistema decide continuamente si necesita seguir escuchando o si ya dispone de suficiente información para producir texto.

Esta arquitectura introduce un equilibrio entre precisión y latencia. Si el modelo espera más contexto antes de transcribir una palabra, puede aumentar la precisión, pero también tarda más en mostrar el resultado. Para solucionar este problema, Meta ha desarrollado un sistema de “adaptive delay”, que modifica dinámicamente el tiempo de espera dependiendo de la dificultad de cada palabra.

Según la explicación técnica publicada por la compañía, este comportamiento se ha entrenado mediante reinforcement learning, combinando recompensas relacionadas con la tasa de errores de palabras y con el retraso de la transcripción. Meta afirma que este sistema permite situar a Muse Voice Transcribe en una posición favorable dentro del equilibrio entre velocidad y precisión.

Más de 25 idiomas y cambios de lengua dentro de una frase

El apartado multilingüe es otro de los elementos destacados por Meta. Muse Voice Transcribe ha sido entrenado con más de 70 idiomas, aunque la compañía señala que 25 de ellos han sido verificados de forma exhaustiva y son los que recomienda probar en el lanzamiento inicial.

Entre los idiomas que aparecen en las demostraciones están chino, francés, hindi, japonés, español y vietnamita. La compañía indica que existe soporte adicional para otros idiomas, aunque la lista de 25 lenguas validadas constituye la referencia principal para comprobar las capacidades del modelo en esta primera versión.

Una característica especialmente interesante es el code-switching, es decir, la posibilidad de cambiar de idioma durante una misma conversación. Meta asegura que Muse puede reconocer estos cambios tanto entre frases como dentro de una misma frase, algo habitual entre personas bilingües que mezclan idiomas de manera natural.

Según Meta, esta capacidad permite que una conversación pueda mezclar diferentes idiomas sin que el usuario tenga que cambiar manualmente la configuración del sistema.

La compañía acompaña esta función con una demostración en la que se mezclan mandarín e inglés dentro de una conversación técnica. El objetivo es mostrar que el sistema no solo identifica los idiomas, sino que puede mantener la transcripción cuando el hablante cambia de lengua de forma espontánea.

El contexto también sirve para mejorar la transcripción

Muse Voice Transcribe incorpora además context biasing, una técnica que permite utilizar información contextual para mejorar el reconocimiento de determinadas palabras. Según Meta, esto puede ayudar especialmente cuando aparecen nombres propios, lugares, contactos o términos que pueden resultar difíciles de identificar únicamente a partir del sonido.

En la demostración de la compañía aparecen términos como Meta, Muse y Menlo Park. La idea, de acuerdo con Meta, es que un sistema de voz destinado a convertirse en una herramienta personal pueda reconocer mejor las palabras que forman parte del contexto habitual de cada usuario.

Esta característica adquiere especial importancia cuando se piensa en asistentes de IA que deben desenvolverse en conversaciones naturales. Una transcripción puede ser correcta en términos generales y, aun así, equivocarse precisamente en nombres, marcas o palabras poco frecuentes. El contexto busca reducir ese tipo de errores.

También puede trabajar con conversaciones de más de una hora

La capacidad del modelo no se limita a fragmentos cortos de audio. Meta afirma que Muse Voice Transcribe admite entradas de audio de más de una hora y puede trabajar con más de 20 interlocutores sin necesidad de aplicar un procesamiento posterior para separar las voces.

Para demostrarlo, la compañía ofrece una grabación de aproximadamente una hora y un minuto en la que intervienen múltiples personas. En ella, el sistema identifica a los participantes mediante etiquetas y mantiene la separación de los distintos hablantes a lo largo de la conversación.

Esta posibilidad puede ser relevante para escenarios como reuniones, entrevistas, conversaciones de grupo o grabaciones extensas. La principal diferencia respecto a una transcripción convencional estaría en que el sistema intenta resolver durante el propio proceso tanto el texto como quién ha pronunciado cada intervención.

Meta quiere que la voz sea una pieza de sus futuros agentes de IA

La presentación de Muse Voice Transcribe encaja, según el planteamiento de Meta, en una visión más amplia de los agentes personales de inteligencia artificial. La compañía sostiene que estos sistemas necesitan capacidades de percepción capaces de entender conversaciones reales y no limitarse a responder a comandos de voz perfectamente estructurados.

En el material publicado por Meta se relaciona esta tecnología con dispositivos como las gafas con IA, donde comprender una conversación mientras ocurre puede ser una capacidad importante. La compañía plantea que un asistente verdaderamente personal necesita poder escuchar, distinguir interlocutores y entender diferentes idiomas sin obligar al usuario a adaptar su forma de hablar.

Meta también presenta el reconocimiento de voz como una tecnología que puede servir para algo más que automatizar tareas. Según la fuente, una mejor comprensión del audio podría utilizarse para crear, expresar ideas o aprender, convirtiendo la percepción de voz en una parte fundamental de futuras herramientas de IA.

Una primera pieza para la estrategia de Meta Superintelligence Labs

La compañía define Muse Voice Transcribe como un primer hito de sus modelos de voz en tiempo real. El lanzamiento llega dentro de Meta Superintelligence Labs, la división que la empresa está utilizando para desarrollar sus próximos sistemas avanzados de inteligencia artificial.

Por ahora, Meta centra la presentación en las capacidades de percepción y en las demostraciones técnicas del modelo. La compañía destaca especialmente la combinación de baja latencia, transcripción multilingüe, diarización y comprensión contextual, cuatro elementos que pueden resultar importantes para construir sistemas capaces de interactuar con personas en conversaciones más naturales.

La propia demostración deja claro que el objetivo no es únicamente conseguir que una máquina convierta audio en texto. Según Meta, el siguiente paso consiste en que los sistemas puedan escuchar una conversación completa, saber quién habla y comprender el contexto mientras todo sucede en tiempo real. Muse Voice Transcribe es, de acuerdo con la compañía, una de las primeras piezas de esa estrategia.

Fuente: https://research.meta.ai/blog/introducing-muse-voice-transcribe


También podría ser de tu interés:

Deja un comentario