¿Alguna vez le has hecho una pregunta a un asistente de voz y lo has visto congelarse dos segundos antes de responder? Esa pausa incómoda no es tu wifi. Es estructural. Y un grupo pequeño de investigadores cree haber encontrado la pieza de la IA que hay que desatascar.

Su artículo apareció en arXiv el 12 de mayo. Título: Multi-Stream LLMs: Unblocking Language Models with Parallel Streams of Thoughts, Inputs and Outputs. Autores: Guinan Su, Yanwu Yang, Xueyan Li y Jonas Geiping. Páginas: 37. Idea central: habría que dejar que la IA mastique chicle y camine a la vez.

El artículo en una frase. Los modelos de lenguaje actuales funcionan sobre una sola vía: leer, luego pensar, luego escribir, luego esperar. Los autores proponen dividir esa vía en varios flujos paralelos (entrada, salida de herramientas, pensamiento interno, respuesta al usuario) que atraviesan el mismo modelo en cada pasada. Lee el resumen en arXiv:2605.12460.

El problema de la pausa

Cada chatbot, asistente de voz, copiloto de programación y función reluciente de «IA en todo» que has usado funciona esencialmente sobre una única cola. El modelo lee tu mensaje, después piensa, después escribe una respuesta, después quizá llama a una herramienta, después espera a la herramienta, después piensa un poco más, después escribe un poco más. Es una carretera de un solo carril, y absolutamente todo hace cola en ella.

El modelo no puede escribir mientras lee. No puede reaccionar a información nueva a media frase. Ni siquiera puede pensar y actuar a la vez, porque la misma maquinaria hace los dos trabajos por turnos. Las personas, con todos nuestros defectos, escuchamos y respondemos al mismo tiempo. Lo más avanzado en IA conversacional en 2026 sigue, técnicamente, sin poder hacerlo.

¿Y cuál es el arreglo?

Los modelos multiflujo son sospechosamente simples, como suelen serlo los buenos artículos de investigación. En lugar de un flujo de tokens atravesando el modelo, los autores le dan varios flujos en paralelo: uno para el texto entrante, otro para los resultados de las herramientas, otro para el razonamiento en cadena y otro para la respuesta que ve el usuario. Cada flujo sigue avanzando en el tiempo, pero todos avanzan juntos. Cada pasada lee de todos los flujos de entrada y escribe en todos los de salida a la vez.

Convertir la carretera de un carril en una autopista de cuatro, con el mismo motor conduciendo. Los autores sostienen que esto además hace los modelos más rápidos (lo paralelo va en paralelo), más seguros (el carril de «entrada del usuario» queda separado por estructura del carril de «razonamiento interno», lo que dificulta la inyección de prompts) y más fáciles de vigilar (puedes ver pensar al modelo en un canal distinto de aquel en el que te habla).

Cómo se notaría esto

Si funciona, y si llega a los asistentes que de verdad usas, las diferencias serían pequeñas y raramente satisfactorias.

  • El asistente del móvil deja de quedarse mudo cuando cambias de idea a media frase. Puede escuchar mientras habla, como una persona con una capacidad de atención aceptable.
  • El bot de atención al cliente responde mientras sigue buscando los datos de tu pedido, no después.
  • El altavoz inteligente ajusta las luces mientras sigue narrando la receta.
  • El asistente de programación sigue escribiendo mientras lee el siguiente archivo, en lugar de apagarse treinta segundos cada vez que le haces una pregunta con enjundia.
  • El agente del navegador que te reserva el vuelo deja de releer la misma página tres veces antes de hacer clic en nada.

Ninguna de estas cosas es emocionante por separado. Pero júntalas y obtienes algo sutil: una IA que se parece menos a un becario lento y más a un asistente rápido y disperso. Sigue sin tener alma. Pero al menos ya no hay sala de espera.

…o quizá no pase nada

También es del todo posible que nada de esto llegue a algo que tú llegues a tocar.

Los grandes laboratorios tienen una cantidad enorme de infraestructura ya funcionando sobre el aburrido formato de flujo único de siempre. Reentrenar modelos de frontera para que mastiquen chicle y caminen a la vez es caro, y ahora mismo ningún cliente está presentando quejas de una forma que asuste a una dirección financiera. Los modelos multiflujo podrían acabar siendo un resultado académico precioso que se queda calladamente en la academia, como decenas de otras ideas prometedoras que nunca pasaron del banco de pruebas.

Hay un riesgo más blando: puede que la experiencia no cambie mucho aunque la tecnología sí lo haga. Estamos acostumbrados a una IA que hace pausas. Hemos construido nuestra paciencia a su alrededor. Más rápido puede significar sencillamente «la misma IA, menos incómoda», que es una mejora, pero no de las que tu tía nota un martes por la tarde.

Y otras investigaciones han mostrado que los agentes se degradan en silencio por razones que no tienen nada que ver con cómo el modelo lee los tokens: escribimos sobre ello en nuestra pieza sobre la erosión del contexto. Los flujos paralelos no van a limpiar el sedimento de una sesión larga.

La respuesta honesta

Probablemente algo intermedio. Artículos como este rara vez cambian la vida de un día para otro, pero fijan qué falla en la generación actual de IA de una manera difícil de ignorar una vez vista. Que los modelos de hoy no puedan leer y pensar al mismo tiempo resulta, visto en retrospectiva, un poco ridículo: como un coche que hay que parar para poder mirar por la ventanilla. Que alguien haya escrito una forma limpia de arreglarlo hace más probable que, dentro de dos o tres años, algún asistente deje de esperar su turno sin que nadie lo anuncie.

Probablemente no habrá una nota de prensa cuando ocurra. Simplemente notarás que el silencio se hizo más corto.