Qué son los modelos de lenguaje pequeños — y por qué los quieren las casas inteligentes
Un modelo de lenguaje pequeño (SLM, por sus siglas en inglés) es un modelo de IA compacto, normalmente por debajo de los tres mil millones de parámetros, diseñado para ejecutarse directamente en un dispositivo y no en un centro de datos remoto. Mediante técnicas como la cuantización (reducir los pesos del modelo de 16 bits a 4 bits o incluso 2 bits de precisión), la poda y la destilación, estos modelos caben dentro de chips con memoria limitada y presupuestos de energía muy ajustados.
Para las casas inteligentes, el atractivo es claro. Un modelo local significa que tu orden de voz nunca sale de casa. Los tiempos de respuesta bajan de los 100 milisegundos porque no hay viaje de ida y vuelta a un servidor. El sistema sigue funcionando cuando se cae internet. Y no hay un coste de nube por consulta comiéndose el margen de un termostato de 50 dólares.
Hoy, la mayoría de altavoces y concentradores inteligentes usan un enfoque partido: un modelo diminuto en el dispositivo detecta la palabra de activación («Hey Google», «Alexa») y todo lo demás se envía a un gran modelo de lenguaje en la nube. Los SLM prometen mover mucho más de ese procesamiento al propio dispositivo. No conversación libre sobre el sentido de la vida — sino entender qué quieres decir cuando dices «apaga las luces de abajo menos la del pasillo» y despachar las órdenes correctas sin esperar a un servidor.
Esa distinción importa. Los modelos de lenguaje pequeños más útiles para casas inteligentes no son modelos de chat. Son modelos de llamada a funciones — entrenados para interpretar una petición en lenguaje natural y devolver una orden estructurada. Google publicó Gemma 3 con 270 millones de parámetros precisamente para este tipo de despacho de herramientas. Ese es un problema distinto y más manejable que la conversación general, y necesita mucho menos cómputo para resolverse bien.
Qué se está vendiendo de verdad ahora mismo
Con todas las demostraciones de escenario y los anuncios de chips, la lista de productos que puedes comprar hoy con un modelo de lenguaje real en el dispositivo sigue siendo corta. Pero ya no está vacía.
El SwitchBot AI Hub salió a la venta en enero de 2026 por 259,99 dólares. Ejecuta un modelo local de visión y lenguaje para el análisis de cámaras y los disparadores de automatización, hace de puente con Apple Inicio, Google Inicio, Alexa y SmartThings mediante Matter, e incorpora un contenedor de Inicio Assistant Core directamente en el concentrador — sin necesidad de Raspberry Pi. Gestiona hasta 100 dispositivos SwitchBot y ocho flujos simultáneos de cámara 2K en local. Detrás de las funciones avanzadas de IA hay una suscripción tras un mes de prueba, lo que dice mucho sobre la economía de la IA en el borde: la inferencia local elimina el coste por consulta, pero no elimina la necesidad de ingresos recurrentes del fabricante.
Xiaomi Miloco (Xiaomi Local Copilot) se presentó en el MWC 2026. Construido sobre el modelo fundacional propio de Xiaomi, MiMo, gestiona automatización multimodal del hogar: detectar desorden y enviar el robot aspirador, ajustar la temperatura de la habitación según el confort y el estado de sueño de la persona, orquestar escenarios con varios dispositivos. El modelo de voz de código abierto de Xiaomi, MiDashengLM-7B, ya está integrado en más de 30 productos suyos a la venta, dando soporte a sistemas de activación, control por gestos y monitorización de sonido. Xiaomi vende cada año más dispositivos de hogar inteligente que Amazon, Google y Apple juntos, así que esto no es un experimento de nicho.
Los robots aspiradores merecen atención como cabeza de puente silenciosa. Ya llevan cámaras, procesadores de visión y batería suficiente para la inferencia. Modelos como el iRobot j7+ y el Roborock S8 ejecutan transformadores de visión para esquivar obstáculos. Añadir un modelo de lenguaje pequeño de llamada a funciones que interprete órdenes naturales («limpia debajo de la mesa del comedor, evita los juguetes de los niños») es un paso corto desde donde ya están — y la demostración de Xiaomi en el MWC mostró exactamente eso.
El silicio que lo hace posible
La historia del hardware en 2026 es más amplia de lo que sugiere casi toda la cobertura. No son solo Qualcomm y Arm.
Google Coral NPU es una unidad de procesamiento neuronal de código abierto basada en RISC-V, codiseñada con Google Research y DeepMind. Entrega 512.000 millones de operaciones por segundo con unos 6 milivatios. Léelo otra vez: seis milivatios. Ese perfil de consumo permite inferencia de IA siempre activa en un aparato que funciona con una pila de botón o un cable de alimentación fino. El Synaptics Astra SL2610, que integra la NPU Coral, ya está en muestreo, con disponibilidad general prevista para el segundo trimestre de 2026. Al ser RISC-V (conjunto de instrucciones abierto, sin licencias por unidad), cambia la aritmética de costes de materiales para los electrodomésticos de margen fino.
El nRF54L de Nordic Semiconductor con NPU Axon es quizá el anuncio más ignorado. Los chips nRF de Nordic ya están dentro de millones de sensores, cerraduras, termostatos y localizadores de hogar inteligente. Añadir una NPU en el chip que acelera los modelos de TensorFlow Lite 15 veces respecto a la ejecución solo en CPU — con soporte nativo de Matter sobre Thread — significa que las líneas de producto existentes pueden ganar capacidades de IA en una revisión de hardware, no en un rediseño completo. En muestreo el segundo trimestre de 2026.
Qualcomm Snapdragon Wear Elite es la primera plataforma para dispositivos vestibles con NPU, capaz de soportar modelos de hasta dos mil millones de parámetros en el dispositivo. Es la señal más fuerte hasta ahora de que los relojes inteligentes y las pulseras de actividad tendrán funciones de lenguaje locales reales, no consultas reenviadas al teléfono. Y el Ethos-U85 de Arm lleva el soporte de transformadores a dispositivos de clase IoT a través del entorno de ejecución ExecuTorch, dando a los fabricantes de electrodomésticos una vía de despliegue familiar.
Qué lo está frenando
El cuello de botella es el ancho de banda de memoria, no el cómputo. Los dispositivos móviles ofrecen entre 50 y 90 GB/s de ancho de banda de memoria; las GPU de centro de datos entregan entre 2 y 3 TB/s. La inferencia de modelos de lenguaje está limitada por la memoria porque todos los pesos del modelo pasan por la memoria en cada token generado. Las cifras de TOPS (billones de operaciones por segundo) que anuncian los fabricantes de chips confunden para esta carga — reflejan escenarios idealizados por lotes, no la decodificación autorregresiva que hace de verdad un SLM al responder tu pregunta. Las pruebas del mundo real muestran una NPU Hailo-10H alcanzando unos 6,9 tokens por segundo en un modelo de 1.500 millones de parámetros, muy lejos de lo que sugerirían sus 40 TOPS. David Patterson, de Google, publicó en enero de 2026 un artículo que documenta que en la última década el cómputo de IA creció 80 veces mientras el ancho de banda de memoria creció solo 17. Esa brecha es estructural.
La limitación térmica mata el «siempre activo». Una prueba de marzo de 2026 encontró que un iPhone 16 Pro pierde el 44% de su rendimiento de inferencia en dos iteraciones bajo carga sostenida de LLM, y que un Samsung Galaxy S24 Ultra llega a un suelo de frecuencia de GPU impuesto por el sistema operativo que termina la inferencia por completo tras seis iteraciones. Una NPU dedicada de bajo consumo por debajo de 5 vatios mantuvo un rendimiento con varianza casi nula de forma indefinida. La implicación: el silicio de borde hecho a propósito superará a los chips de teléfono reutilizados en cargas de agentes siempre activos, incluso con menos cómputo pico.
La seguridad es el problema sin cartografiar. Un concentrador de hogar inteligente ejecutando un SLM local que controla cerraduras, cámaras y alarmas es un objetivo de seguridad radicalmente distinto de un termostato con reglas simples. La investigación reciente documenta vectores de ataque concretos: inyección de instrucciones a través de entradas de sensor adversarias, extracción del modelo desde dispositivos físicos y fugas de privacidad a través de respuestas del modelo basadas en datos personales. El sector apenas ha empezado a abordarlos. Vale la pena ver cómo lo gestionan los primeros productos — y si eso frena la adopción.
Qué vigilar en los próximos 12 meses
La infraestructura ya llegó. Los productos están empezando. Esto es lo que separa la «curiosidad de los primeros usuarios» de «tu próxima mejora del hogar inteligente» durante el próximo año.
Disponibilidad de chips. El nRF54L de Nordic y el Synaptics SL2610 basado en Coral de Google apuntan ambos a disponibilidad amplia a mediados de 2026. Si los dos llegan a tiempo con buenas herramientas para desarrolladores, cabe esperar una oleada de fabricantes más pequeños añadiendo funciones de IA local a sensores, concentradores y cámaras antes de fin de año.
Transparencia en los precios de suscripción. SwitchBot cobra por las funciones avanzadas de IA después de una prueba. Si otros productos de IA en el borde siguen el mismo patrón, los precios de suscripción revelarán el coste real por usuario de ejecutar modelos en el dispositivo — y si es lo bastante bajo para aparatos de gran consumo.
Si alguna gran marca occidental de electrodomésticos responde a Xiaomi. El Miloco de Xiaomi ya está integrado en más de 30 productos. Samsung tiene su frigorífico Bespoke AI con Gemini. El Alexa+ de Amazon es más listo, pero sigue dependiendo de la nube. La presión competitiva es real. Si una marca occidental de primer nivel anuncia una línea de producto con SLM local en 2026, la categoría cambia de curva.
La presión regulatoria transfronteriza también está acelerando el cambio. Las normas de privacidad y gobernanza de datos de los mercados avanzados favorecen cada vez más arquitecturas que mantienen los datos personales en el dispositivo. Para los fabricantes que venden en varias jurisdicciones, la inferencia local puede convertirse en el camino de menor fricción regulatoria, y no solo en una función de privacidad.
La siguiente pregunta no es si los modelos de lenguaje pequeños funcionan en las casas inteligentes. El concentrador de SwitchBot, el ecosistema de Xiaomi y la comunidad de Inicio Assistant ya la han respondido. La pregunta es si los fabricantes pueden hacer que las cuentas salgan en la franja de dispositivos de 50 a 100 dólares, y no solo en la del concentrador premium de 260. El silicio que llega a mediados de 2026 sugiere que quizá sí.
Preguntas frecuentes
¿Qué es un modelo de lenguaje pequeño?
Un modelo de IA compacto — normalmente por debajo de los tres mil millones de parámetros — diseñado para ejecutarse directamente en un dispositivo en lugar de necesitar un servidor en la nube. Piénsalo como una versión reducida de ChatGPT o Gemini que cambia amplitud de conocimiento por velocidad, privacidad y capacidad de funcionar sin conexión.
¿Pueden los modelos de lenguaje pequeños funcionar hoy en dispositivos de hogar inteligente?
Sí. El SwitchBot AI Hub (259,99 dólares) y Xiaomi Miloco se venden en 2026 con modelos de lenguaje en el dispositivo. La pila de código abierto Inicio Assistant también puede ejecutar un asistente de voz local en una Raspberry Pi 4 sin ninguna dependencia de la nube.
¿Cuál es la diferencia entre un SLM y un gran modelo de lenguaje para casas inteligentes?
Los SLM se ejecutan localmente en el propio dispositivo — respuestas más rápidas, funcionan sin conexión, los datos se quedan en privado. Los grandes modelos de lenguaje (LLM) suelen ejecutarse en servidores en la nube, ofreciendo capacidades más amplias pero exigiendo conexión a internet e introduciendo latencia y concesiones de privacidad.
¿Necesito hardware especial para la IA en el dispositivo en mi casa inteligente?
Los nuevos chips con NPU (Google Coral, Nordic Axon, Qualcomm Snapdragon Wear Elite) lo ponen más fácil, pero hoy puedes ejecutar un asistente de voz local básico en una Raspberry Pi 4 con software de código abierto.