Revolución IA

Microsoft MAI-Realtime: la voz de IA que te interrumpe (y te escucha) en tiempo real

Microsoft MAI-Realtime: la voz de IA que te interrumpe (y te escucha) en tiempo real
  • Publicadoagosto 5, 2026

Mientras el mundo de la IA sigue obsesionado con el texto, la próxima gran pelea se está librando en la voz. Y Microsoft acaba de mostrar la carta que tenía escondida: MAI-Realtime, su primer modelo de voz nativo capaz de escuchar y hablar al mismo tiempo, como lo hace una persona real en una conversación.

El detalle: Microsoft no lo anunció. Apareció el 2 de agosto de 2026 como una entrada oculta de acceso anticipado dentro de su MAI Playground, sin blog, sin ficha técnica y sin precios, según reportó el medio especializado TestingCatalog. Un puñado de socios ya lo está probando.

Qué hace diferente a MAI-Realtime

La clave está en dos palabras: full-duplex. Los asistentes de voz tradicionales funcionan por turnos: tú hablas, él procesa, él responde. MAI-Realtime rompe ese esquema. Es un único sistema que escucha, razona y habla mientras el usuario todavía está hablando, igual que dos personas que se interrumpen, se pisan una frase o se ríen a la vez.

Eso lo coloca en competencia directa con modelos como GPT Live de OpenAI y Sesame. Según las pruebas filtradas, se siente mucho más natural que MAI Voice 2, el modelo anterior de Microsoft, y puede operar búsqueda web y otras herramientas mientras conversa.

Los socios con acceso reportan dos voces por ahora, llamadas Victoria y Grant, con manejo configurable de interrupciones. Para gestionar cuándo cortar y cuándo esperar, el modelo usa dos enfoques seleccionables: uno llamado Switchboard, basado en un detector de fin de turno propio de Microsoft (MAI-Ears), y otro que combina silencio con un detector semántico tipo Whisper.

Habla español (y eso importa para LatAm)

Aquí está el dato que nos toca de cerca. MAI-Realtime soporta 17 idiomas, y el español está en la lista, junto a inglés, alemán, francés, italiano, portugués, japonés, coreano, chino, holandés, hindi, indonesio, árabe, ruso, turco, vietnamita y tailandés.

Para América Latina, un modelo de voz verdaderamente conversacional en español abre la puerta a call centers, asistentes de atención al cliente y educación por voz que no suenen robóticos ni obliguen al usuario a esperar el turno del bot. La barrera nunca fue solo el idioma, sino la naturalidad: interrumpir, corregir a media frase, retomar. Eso es justamente lo que promete el full-duplex.

El portugués también está soportado, lo que suma a Brasil al mapa. Si Microsoft integra esto en Copilot y en Azure —donde ya presentó mejoras de voz en tiempo real en Build 2026— el costo de montar un agente de voz en la región podría caer fuerte.

Lo que todavía no sabemos

Falta lo esencial para tomarlo en serio como producto: no hay precios, no hay ficha técnica pública, no hay fecha de lanzamiento y no hay confirmación oficial de Microsoft. Por ahora es una filtración de una preview oculta, no un anuncio. Vale la pena seguirlo, pero con cautela: entre una demo interna y un producto estable en producción suele haber varios meses.

Lo que sí es claro es la dirección: después de lanzar siete modelos MAI propios en Build 2026, Microsoft dejó de depender exclusivamente de OpenAI y está construyendo su propio stack, voz incluida. La guerra de los asistentes que suenan humanos apenas empieza.


Lee también:

Comparte en:
Escrito por
admin