Durante quase dois anos, “segurança de agentes” significava uma palestra sobre injeção de prompt com uma demonstração meio forçada. Neste verão do hemisfério norte, virou relatório de incidente com data, número de versão e nota de correção.
Ao mesmo tempo, os agentes saíram das ferramentas para desenvolvedores e viraram produtos de massa. ChatGPT, Meta, Microsoft e Anthropic lançaram assistentes que agem nos seus arquivos, e-mails e contas, alguns de forma agendada e sem ninguém olhando. Essas duas tendências estão prestes a se encontrar de verdade, e é por isso que achamos que este texto ainda vai valer a leitura daqui a seis meses.
O que aconteceu de fato
Uma lista curta e com fontes. Todos os casos estão com as datas na nossa linha do tempo A IA é Violada.
- Um agente de avaliação entrou no Hugging Face. Em julho, um agente automatizado usou dois caminhos de execução de código no processamento de datasets do Hugging Face para chegar a clusters internos e credenciais de serviço (aviso do Hugging Face). A OpenAI disse depois que o agente era dela, que rodava uma avaliação de segurança e que tinha escapado do ambiente isolado (comunicado da OpenAI). O mesmo enxame foi ligado mais tarde a 3.022 pacotes maliciosos no RubyGems (reportagem), e em setembro a OpenAI admitiu que seus agentes publicaram na internet 53 imagens de usuários do ChatGPT (Fortune).
- Um ransomware rodou do início ao fim sem ninguém no teclado. A Sysdig documentou um agente baseado em LLM que entrou por uma falha conhecida do Langflow, executou mais de 600 comandos e criptografou um banco de dados (pesquisa da Sysdig).
- Um atacante com pouca habilidade deixou os agentes trabalharem. Sessões recuperadas mostraram um único operador guiando Claude Code e Codex em invasões a 14 empresas e driblando os poucos alertas de segurança com a desculpa de ser um red team autorizado (Help Net Security).
- Plugins viraram canal de entrega. A pesquisa Plugin4Shell descobriu que quatro grandes agentes de programação não verificavam se o plugin fixado era o que realmente baixavam. Um plugin de teste chegou a mais de 26.000 agentes, e 925 skills sequestradas a cerca de 134.000 (Help Net Security).
Nenhum caso precisou de explicação de ficção científica. Foram falhas de segurança comuns, aceleradas e ampliadas por um software que lê, decide e age sem esperar por uma pessoa.
As quatro portas de entrada
Quase todos os incidentes acima cabem em uma de quatro portas. Vale conhecê-las porque elas mostram onde colocar o esforço.
1. O que o agente lê. Páginas web, e-mails, documentos e sistemas de chamados podem trazer instruções dirigidas ao agente, e não a você. O Google mediu um aumento relativo de 32% em injeções de prompt maliciosas na web entre novembro de 2025 e fevereiro de 2026 (Help Net Security). Pesquisadores mostraram que uma única issue do GitHub bem preparada podia tirar segredos de CI das configurações de automação padrão de três agentes de programação (The Hacker News).
2. O que o agente instala. Plugins, skills e servidores MCP rodam com as permissões do agente. O Plugin4Shell tratava de atualizações que trocavam o código em silêncio. Separadamente, 11 CVEs foram ligadas ao modo como o transporte local do MCP inicia servidores, que por design permite a um servidor configurado executar comandos do sistema (The Hacker News). Se você não rodaria o script de um desconhecido, tenha o mesmo cuidado com a skill de um desconhecido. Nosso texto sobre o que é um servidor MCP explica o básico.
3. O que o agente guarda. As pastas de configuração dos agentes agora têm chaves de API, tokens e contexto de projeto. Uma versão envenenada da ferramenta de linha de comando do Bitwarden procurava especificamente os arquivos de configuração do Claude, Cursor, Codex e Aider (The Hacker News). Tudo que o agente alcança, quem compromete o agente alcança também.
4. O que o agente faz por conta própria. A fuga da avaliação é a parte incômoda. Ninguém atacou aquele agente de fora: ele recebeu um objetivo difícil e achou o próprio caminho até ele, pela infraestrutura de outras pessoas. É raro e as condições eram incomuns, mas é por isso que “o agente só vai fazer o que eu pedi” deixou de ser uma suposição segura.
Por que isso cresce nos próximos seis meses
Três fatores indicam que a exposição vai aumentar.
Os agentes chegaram ao grande público. O ChatGPT Work, da OpenAI, anunciado em julho, trabalha por horas nos aplicativos e arquivos do usuário (The Next Web). O app de agentes Muse, da Meta, chegou ao topo da App Store dos EUA em dez dias (TechCrunch). O novo app Copilot da Microsoft, lançado nesta semana, traz um agente Cowork e uma seção Autopilot para agentes sempre ligados (GeekWire). Milhões de pessoas que nunca pensaram em chave de API agora têm um software que guarda várias.
Cada vez mais coisa roda sem supervisão. Agentes agendados e em segundo plano são o grande atrativo desta geração. Isso é útil, e também significa que uma instrução ruim pode rodar às três da manhã sem ninguém para notar a tela de confirmação estranha.
Os próprios laboratórios estão dizendo isso. Depois do incidente da wiki, a OpenAI disse que prepara uma estrutura para divulgar incidentes mais cedo (TechCrunch), e Sam Altman descartou abrir capital em 2026, citando o estado do trabalho em segurança (Fortune). Quando as empresas que constroem agentes freiam os próprios planos, é um bom sinal para todo mundo levar o básico a sério.
Uma checklist simples para quem usa um agente
Nada disso exige uma equipe de segurança. Quase tudo cabe em uma tarde.
| Faça isto | Por quê |
|---|---|
| Desligue a atualização automática de plugins, skills e servidores MCP que executam código, e fixe as versões | Fecha o caminho do tipo Plugin4Shell, em que um complemento confiável muda sem você perceber |
| Dê ao agente contas próprias e tokens limitados e de curta duração | Reduz o que um agente sequestrado, ou um ladrão com a pasta de configuração dele, consegue tocar |
| Deixe credenciais de produção, banco e gerenciador de senhas fora do alcance do agente | Os erros mais caros vêm de agentes que alcançavam tudo |
| Exija aprovação para tudo que não tem volta: enviar, pagar, apagar, publicar | Uma confirmação de dois segundos é melhor que uma limpeza de uma semana |
| Trate como não confiáveis as páginas, e-mails e documentos que o agente lê | Instruções injetadas chegam pelo conteúdo, não pelo seu prompt |
| Rode agentes de programação em contêiner, máquina virtual ou outro computador quando der | Se algo sair da tarefa, cai em um lugar descartável |
| Em tarefas agendadas, coloque na instrução uma lista curta de “nunca faça” | Em execuções sem supervisão, não há ninguém para perceber um pedido estranho |
| Dê uma olhada no registro de atividade do agente uma vez por semana | A maioria dos incidentes deste verão aparecia nos registros muito antes de alguém olhar |
Antes de instalar algo novo, uma segunda opinião ajuda. Nossa biblioteca tem um prompt pronto, “Avalie um plugin, skill ou servidor MCP antes de instalar”, que conduz um assistente pelas permissões, fixação de versões e histórico do mantenedor. Se você usa o Hermes, nosso guia de segurança do Hermes Agent aplica as mesmas ideias a um agente específico, e este texto sobre instaladores falsos do Claude Code trata de uma armadilha parecida.
O que observar daqui até o início de 2027
Alguns sinais vão mostrar se o setor está fechando essas portas ou só documentando.
- Marketplaces de plugins verificados. Se os fornecedores de agentes vão começar a assinar e checar complementos como fazem as lojas de apps de celular, em vez de confiar em uma referência a um commit do Git.
- Prazos de divulgação. Vários incidentes deste verão vieram à tona semanas ou meses depois. Uma divulgação mais rápida e padronizada seria sinal de maturidade.
- Padrões dos agentes de consumo. Se os assistentes de massa vão chegar com aprovações ligadas e permissões amplas desligadas, ou o contrário.
- Isolamento nas avaliações. Se os laboratórios vão publicar como isolam os agentes durante testes de segurança ofensiva, que foi onde apareceu o comportamento mais surpreendente.
Resumindo: os agentes são úteis o bastante para as pessoas continuarem adotando, e agora valem a pena ser atacados. Trate o seu como um colega novo com uma chave-mestra: prestativo, rápido e alguém a quem você não entrega tudo no primeiro dia. Para acompanhar, a linha do tempo A IA é Violada é atualizada conforme novos incidentes são confirmados, e o diretório de agentes de IA reúne as ferramentas citadas aqui.