Google hace oficial Gemini 3.8 Live con Live Avatar para empresas y agentes de IA en tiempo real

Google hace oficial Gemini 3.8 Live con Live Avatar para empresas y agentes de IA en tiempo real 2

Google ha anunciado la disponibilidad general de Gemini 3.8 Live con Live Avatar, una tecnología de inteligencia artificial conversacional que combina voz, vídeo y comprensión visual para crear agentes capaces de interactuar en tiempo real. La compañía había mostrado esta tecnología por primera vez durante Google Cloud Next 2026 y ahora la incorpora oficialmente a Gemini Enterprise para entornos de producción empresarial.

La propuesta combina la capacidad de conversación speech-to-speech de Gemini 3.8 Live con una presencia visual basada en avatares. Según Google Cloud, los agentes pueden utilizarse en web, dispositivos móviles y kioscos interactivos, mientras procesan conversaciones, imágenes, vídeo y llamadas a herramientas en segundo plano.

Una IA conversacional que incorpora vídeo

Una de las principales novedades de Gemini 3.8 Live es la incorporación de Live Avatar, que permite generar avatares de vídeo capaces de mantener conversaciones con sincronización labial. Google señala que los clientes pueden utilizar una biblioteca de avatares prediseñados, mientras que la creación de avatares personalizados está limitada actualmente mediante un sistema de allowlist y verificación empresarial.

El planteamiento de Google busca llevar los agentes de voz más allá de una conversación basada exclusivamente en audio. El usuario puede interactuar con un agente que cuenta con una representación visual mientras el sistema continúa procesando las peticiones. La compañía presenta esta combinación como una forma de construir experiencias conversacionales para distintos canales y escenarios empresariales.

La tecnología también incorpora comprensión visual en directo. Gemini 3.8 Live puede procesar al mismo tiempo la señal de una cámara, una pantalla compartida y el audio de una conversación. Esto permite diseñar agentes que no solo responden a lo que dice una persona, sino que también pueden interpretar aquello que está mostrando durante la interacción.

Conversaciones más naturales y llamadas a herramientas

Google destaca el uso de una arquitectura nativa de speech-to-speech, con la que pretende mejorar la naturalidad de los diálogos. Una de sus características es la gestión de interrupciones: el agente puede continuar una conversación cuando el usuario interviene sin perder el contexto acumulado o las operaciones que se están ejecutando en segundo plano.

Otro elemento importante es el tool calling. Gemini 3.8 Live puede realizar llamadas a herramientas y APIs mientras mantiene la conversación con el usuario. De esta forma, el agente puede reconocer una solicitud, informar de que está realizando una operación y continuar interactuando mientras la tarea se completa.

Google también asegura que Gemini 3.8 Live entiende y habla 97 idiomas, con detección automática del idioma. Esta capacidad está pensada para aplicaciones que necesitan mantener conversaciones con usuarios de diferentes mercados sin tener que diseñar un flujo separado para cada idioma.

Disponibilidad para empresas en Estados Unidos y Europa

Gemini 3.8 Live con Live Avatar está disponible de forma general en Gemini Enterprise, con endpoints para Estados Unidos y la Unión Europea. Google también señala que la oferta cuenta con throughput provisionado, cumplimiento empresarial y mecanismos de gobernanza de datos destinados a escenarios de producción.

La compañía mantiene, por otro lado, Gemini 3.8 Live Extended Thinking en fase de preview privada. Esto significa que la disponibilidad general anunciada se refiere específicamente a Gemini 3.8 Live con Live Avatar y no a todas las variantes de la familia presentada recientemente por Google.

Para los desarrolladores, Google ofrece acceso mediante la Gemini Live API. También se puede utilizar Agent Development Kit, conocido como ADK, para definir agentes, gestionar runners y memoria de sesión y transmitir audio en tiempo real hacia la API sin necesidad de utilizar una arquitectura tradicional basada primero en speech-to-text.

Ejemplos de uso de los nuevos agentes

Google muestra varios escenarios para ilustrar las posibilidades de Gemini 3.8 Live. Uno de ellos está relacionado con la gestión de siniestros de seguros. En el ejemplo, una persona habla con un agente mientras utiliza la cámara para mostrar los daños. El sistema puede completar la información del expediente mientras, en segundo plano, un equipo de agentes comprueba la póliza y aplica las reglas necesarias.

Otro caso procede de Cox Automotive, que ha desarrollado un asistente basado en IA para Autotrader. Según Google, el sistema utiliza resaltado de pantalla en directo y llamadas a herramientas para ayudar a los usuarios a buscar vehículos, compararlos y avanzar en procesos relacionados con la financiación mediante una conversación natural.

Google también recoge el caso de Equal AI. Según la compañía, su sistema gestiona más de un millón de llamadas en directo al día en nueve idiomas indios. Su responsable ejecutivo asegura que Gemini 3.8 Live ha mejorado la gestión de interrupciones, las conversaciones multilingües y la fiabilidad de las llamadas a herramientas dentro de este escenario.

Google incorpora medidas para identificar contenido generado por IA

La expansión de los avatares también lleva asociadas medidas de seguridad. Google explica que los flujos de audio y vídeo generados incorporan marcas de agua imperceptibles mediante SynthID. El objetivo declarado es facilitar la identificación y verificación del contenido generado por inteligencia artificial.

La creación de avatares personalizados tampoco está abierta sin restricciones. Según Google Cloud, esta posibilidad permanece sometida a un proceso de allowlisting y verificación empresarial, mientras que los clientes pueden desplegar avatares seleccionados de una biblioteca previamente preparada.

Con la disponibilidad general de Gemini 3.8 Live con Live Avatar, Google traslada sus agentes conversacionales multimodales desde las demostraciones y previews hacia entornos empresariales de producción. La combinación de voz, vídeo, comprensión visual y ejecución de herramientas sitúa la nueva propuesta dentro de una generación de agentes diseñados para realizar tareas mientras mantienen una interacción continua con el usuario.


También podría ser de tu interés:

Deja un comentario