O que são os modelos de linguagem pequenos — e por que as casas inteligentes os querem
Um modelo de linguagem pequeno (SLM, na sigla em inglês) é um modelo de IA compacto, normalmente abaixo de três bilhões de parâmetros, projetado para rodar direto em um aparelho e não em um data center distante. Com técnicas como a quantização (reduzir os pesos do modelo de 16 bits para 4 bits ou até 2 bits de precisão), a poda e a destilação, esses modelos cabem em chips com memória limitada e orçamentos de energia bem apertados.
Para as casas inteligentes, o apelo é direto. Um modelo local significa que o seu comando de voz nunca sai de casa. Os tempos de resposta caem abaixo de 100 milissegundos porque não há ida e volta até um servidor. O sistema continua funcionando quando a internet cai. E não existe um custo de nuvem por consulta comendo a margem de um termostato de 50 dólares.
Hoje, a maioria das caixas de som e dos hubs inteligentes usa uma abordagem dividida: um modelo minúsculo no aparelho detecta a palavra de ativação (“Hey Google”, “Alexa”) e todo o resto vai para um grande modelo de linguagem na nuvem. Os SLMs prometem levar muito mais desse processamento para o próprio aparelho. Não conversa livre sobre o sentido da vida — mas entender o que você quer dizer quando fala “apaga as luzes de baixo, menos a do corredor” e despachar os comandos certos sem esperar um servidor.
Essa distinção importa. Os modelos de linguagem pequenos mais úteis para casas inteligentes não são modelos de chat. São modelos de chamada de função — treinados para interpretar um pedido em linguagem natural e devolver um comando estruturado. O Google lançou o Gemma 3 com 270 milhões de parâmetros justamente para esse tipo de despacho de ferramentas. Esse é um problema diferente e mais tratável do que a conversa geral, e exige muito menos computação para ser resolvido bem.
O que está realmente à venda agora
Apesar de todas as demonstrações de palco e dos anúncios de chips, a lista de produtos que você pode comprar hoje com um modelo de linguagem de verdade no aparelho ainda é curta. Mas já não está vazia.
O SwitchBot AI Hub entrou à venda em janeiro de 2026 por 259,99 dólares. Ele roda um modelo local de visão e linguagem para análise de câmeras e gatilhos de automação, faz ponte com Apple Início, Google Início, Alexa e SmartThings via Matter e embarca um contêiner do Início Assistant Core direto no hub — sem precisar de Raspberry Pi. Dá conta de até 100 aparelhos SwitchBot e oito fluxos simultâneos de câmera 2K localmente. Há uma assinatura por trás dos recursos avançados de IA depois de um mês de teste, o que diz muito sobre a economia da IA na borda: a inferência local elimina o custo por consulta, mas não elimina a necessidade de receita recorrente do fabricante.
O Xiaomi Miloco (Xiaomi Local Copilot) estreou na MWC 2026. Construído sobre o modelo fundacional próprio da Xiaomi, o MiMo, ele cuida de automação multimodal da casa: detectar bagunça e acionar o robô aspirador, ajustar a temperatura do cômodo conforme o conforto e o estado de sono da pessoa, orquestrar cenários com vários aparelhos. O modelo de voz de código aberto da Xiaomi, o MiDashengLM-7B, já está embarcado em mais de 30 produtos da marca à venda, sustentando sistemas de ativação, controle por gestos e monitoramento de som. A Xiaomi vende por ano mais aparelhos de casa inteligente que Amazon, Google e Apple somadas, então isso não é um experimento de nicho.
Os robôs aspiradores merecem atenção como uma cabeça de ponte discreta. Eles já carregam câmeras, processadores de visão e bateria suficiente para inferência. Modelos como o iRobot j7+ e o Roborock S8 rodam transformadores de visão para desviar de obstáculos. Acrescentar um modelo de linguagem pequeno de chamada de função para interpretar comandos naturais (“limpa embaixo da mesa de jantar, desvia dos brinquedos das crianças”) é um passo curto a partir de onde eles já estão — e a demonstração da Xiaomi na MWC mostrou exatamente isso.
O silício que torna isso possível
A história do hardware em 2026 é mais ampla do que sugere a maior parte da cobertura. Não são só Qualcomm e Arm.
A Google Coral NPU é uma unidade de processamento neural de código aberto baseada em RISC-V, coprojetada com a Google Research e a DeepMind. Ela entrega 512 bilhões de operações por segundo com cerca de 6 miliwatts. Leia de novo: seis miliwatts. Esse perfil de consumo permite inferência de IA sempre ligada em um aparelho que funciona com uma pilha botão ou um cabo de energia fino. O Synaptics Astra SL2610, que integra a NPU Coral, já está em amostragem, com disponibilidade geral prevista para o segundo trimestre de 2026. Por ser RISC-V (conjunto de instruções aberto, sem licenciamento por unidade), ele muda a aritmética de custo de materiais para eletrodomésticos de margem fina.
O nRF54L da Nordic Semiconductor com NPU Axon é talvez o anúncio mais ignorado. Os chips nRF da Nordic já estão dentro de milhões de sensores, fechaduras, termostatos e rastreadores de casa inteligente. Acrescentar uma NPU no chip que acelera modelos do TensorFlow Lite 15 vezes em relação à execução só em CPU — com suporte nativo a Matter sobre Thread — significa que linhas de produto existentes podem ganhar recursos de IA em uma revisão de hardware, não em um redesenho completo. Em amostragem no segundo trimestre de 2026.
O Qualcomm Snapdragon Wear Elite é a primeira plataforma para vestíveis com NPU, com suporte a modelos de até dois bilhões de parâmetros no aparelho. É o sinal mais forte até agora de que relógios inteligentes e pulseiras de atividade vão ganhar recursos de linguagem locais de verdade, e não consultas repassadas ao celular. E o Ethos-U85 da Arm leva o suporte a transformadores para aparelhos de classe IoT através do ambiente de execução ExecuTorch, dando aos fabricantes de eletrodomésticos um caminho de implantação familiar.
O que está segurando isso
O gargalo é a largura de banda de memória, não a computação. Aparelhos móveis oferecem de 50 a 90 GB/s de largura de banda de memória; GPUs de data center entregam de 2 a 3 TB/s. A inferência de modelos de linguagem é limitada pela memória porque todos os pesos do modelo passam pela memória a cada token gerado. Os números de TOPS (trilhões de operações por segundo) que os fabricantes de chips anunciam confundem nessa carga — eles refletem cenários idealizados em lote, e não a decodificação autorregressiva que um SLM realmente faz ao responder à sua pergunta. Testes do mundo real mostram uma NPU Hailo-10H alcançando cerca de 6,9 tokens por segundo em um modelo de 1,5 bilhão de parâmetros, muito longe do que seus 40 TOPS sugeririam. David Patterson, do Google, publicou em janeiro de 2026 um artigo documentando que, na última década, a computação de IA cresceu 80 vezes enquanto a largura de banda de memória cresceu apenas 17. Essa lacuna é estrutural.
A limitação térmica mata o “sempre ligado”. Um teste de março de 2026 constatou que um iPhone 16 Pro perde 44% da sua vazão de inferência em duas iterações sob carga sustentada de LLM, e que um Samsung Galaxy S24 Ultra atinge um piso de frequência de GPU imposto pelo sistema operacional que encerra a inferência por completo depois de seis iterações. Uma NPU dedicada de baixo consumo abaixo de 5 watts manteve desempenho com variância quase nula indefinidamente. A implicação: silício de borda feito sob medida vai superar chips de celular reaproveitados em cargas de agentes sempre ligados, mesmo com menos computação de pico.
A segurança é o problema não mapeado. Um hub de casa inteligente rodando um SLM local que controla fechaduras, câmeras e alarmes é um alvo de segurança radicalmente diferente de um termostato com regras simples. A pesquisa recente documenta vetores de ataque específicos: injeção de prompt por meio de entradas de sensor adversárias, extração de modelo a partir de aparelhos físicos e vazamento de privacidade por respostas do modelo baseadas em dados pessoais. O setor mal começou a lidar com isso. Vale acompanhar como os primeiros produtos tratam a questão — e se isso freia a adoção.
O que observar nos próximos 12 meses
A infraestrutura chegou. Os produtos estão começando. Eis o que separa a “curiosidade de quem adota cedo” da “sua próxima melhoria de casa inteligente” no próximo ano.
Disponibilidade de chips. O nRF54L da Nordic e o Synaptics SL2610 baseado no Coral do Google miram ambos disponibilidade ampla em meados de 2026. Se os dois saírem no prazo com boas ferramentas para desenvolvedores, espere uma onda de fabricantes menores acrescentando recursos de IA local a sensores, hubs e câmeras até o fim do ano.
Transparência nos preços de assinatura. A SwitchBot cobra pelos recursos avançados de IA depois de um teste. Se outros produtos de IA na borda seguirem o mesmo padrão, os preços de assinatura vão revelar o custo real por usuário de rodar modelos no aparelho — e se ele é baixo o bastante para aparelhos de massa.
Se alguma grande marca ocidental de eletrodomésticos vai responder à Xiaomi. O Miloco da Xiaomi já está embarcado em mais de 30 produtos. A Samsung tem a geladeira Bespoke AI com Gemini. O Alexa+ da Amazon é mais esperto, mas continua dependente da nuvem. A pressão competitiva é real. Se uma marca ocidental de primeira linha anunciar uma linha de produtos com SLM local em 2026, a categoria muda de curva.
A pressão regulatória transfronteiriça também está acelerando a virada. As regras de privacidade e governança de dados dos mercados avançados favorecem cada vez mais arquiteturas que mantêm os dados pessoais no aparelho. Para fabricantes que vendem em várias jurisdições, a inferência local pode virar o caminho de menor atrito regulatório, e não apenas um recurso de privacidade.
A próxima pergunta não é se os modelos de linguagem pequenos funcionam em casas inteligentes. O hub da SwitchBot, o ecossistema da Xiaomi e a comunidade do Início Assistant já responderam isso. A pergunta é se os fabricantes conseguem fechar a conta na faixa de aparelhos de 50 a 100 dólares, e não só na do hub premium de 260. O silício que chega em meados de 2026 sugere que talvez consigam.
Perguntas frequentes
O que é um modelo de linguagem pequeno?
Um modelo de IA compacto — normalmente abaixo de três bilhões de parâmetros — projetado para rodar direto em um aparelho em vez de precisar de um servidor na nuvem. Pense nele como uma versão reduzida do ChatGPT ou do Gemini, que troca amplitude de conhecimento por velocidade, privacidade e a capacidade de funcionar offline.
Os modelos de linguagem pequenos já rodam em aparelhos de casa inteligente hoje?
Sim. O SwitchBot AI Hub (259,99 dólares) e o Xiaomi Miloco são vendidos em 2026 com modelos de linguagem no aparelho. A pilha de código aberto do Início Assistant também roda um assistente de voz local em um Raspberry Pi 4 sem nenhuma dependência de nuvem.
Qual é a diferença entre um SLM e um grande modelo de linguagem para casas inteligentes?
Os SLMs rodam localmente no próprio aparelho — respostas mais rápidas, funcionam offline, os dados ficam privados. Os grandes modelos de linguagem (LLMs) normalmente rodam em servidores na nuvem, oferecendo capacidades mais amplas, mas exigindo conexão com a internet e trazendo latência e concessões de privacidade.
Preciso de hardware especial para IA no dispositivo na minha casa inteligente?
Os novos chips com NPU (Google Coral, Nordic Axon, Qualcomm Snapdragon Wear Elite) facilitam, mas hoje você já roda um assistente de voz local básico em um Raspberry Pi 4 com software de código aberto.