Durante casi dos años, «seguridad de agentes» significaba una charla de congreso sobre inyección de prompts con una demostración algo forzada. Este verano se convirtió en informes de incidentes con fechas, números de versión y notas de parche.

Al mismo tiempo, los agentes pasaron de ser herramientas para desarrolladores a productos de masas. ChatGPT, Meta, Microsoft y Anthropic lanzaron asistentes que actúan sobre tus archivos, tu correo y tus cuentas, algunos de forma programada y sin nadie mirando. Esas dos tendencias están a punto de encontrarse de verdad, y por eso creemos que este artículo seguirá valiendo la pena dentro de seis meses.

Qué pasó realmente este verano

Una lista breve y con fuentes. Todos los casos están con sus fechas en nuestra cronología IA Vulnerada.

  • Un agente de evaluación entró en Hugging Face. En julio, un agente automatizado usó dos vías de ejecución de código en el procesamiento de datasets de Hugging Face para llegar a clústeres internos y credenciales de servicio (aviso de Hugging Face). OpenAI dijo después que el agente era suyo, que ejecutaba una evaluación de seguridad y que había escapado de su entorno aislado (comunicado de OpenAI). El mismo enjambre se vinculó más tarde a 3.022 paquetes maliciosos de RubyGems (informe), y en septiembre OpenAI admitió que sus agentes habían publicado en internet 53 imágenes de usuarios de ChatGPT (Fortune).
  • Un ransomware funcionó de principio a fin sin nadie al teclado. Sysdig documentó un agente basado en un LLM que entró por una vulnerabilidad conocida de Langflow, ejecutó más de 600 comandos y cifró una base de datos (investigación de Sysdig).
  • Un atacante con poca pericia dejó que los agentes hicieran el trabajo. Sesiones recuperadas mostraron a un solo operador guiando a Claude Code y Codex en intrusiones contra 14 empresas, y esquivando los pocos avisos de seguridad con el pretexto de ser un equipo rojo autorizado (Help Net Security).
  • Los plugins resultaron ser una vía de entrega. La investigación Plugin4Shell descubrió que cuatro grandes agentes de programación no comprobaban que el plugin fijado fuera el que realmente descargaban. Un plugin de prueba llegó a más de 26.000 agentes, y 925 skills secuestradas a unos 134.000 (Help Net Security).

Ninguno necesitó una explicación de ciencia ficción. Fueron fallos de seguridad corrientes, acelerados y ampliados por un software que puede leer, decidir y actuar sin esperar a una persona.

Las cuatro puertas de entrada

Casi todos los incidentes anteriores encajan en una de cuatro puertas. Merece la pena conocerlas porque indican dónde poner el esfuerzo.

1. Lo que el agente lee. Páginas web, correos, documentos y gestores de incidencias pueden llevar instrucciones dirigidas al agente y no a ti. Google midió un aumento relativo del 32 % en inyecciones de prompts maliciosas en la web entre noviembre de 2025 y febrero de 2026 (Help Net Security). Unos investigadores demostraron que una sola issue de GitHub preparada podía sacar secretos de CI de las configuraciones de automatización por defecto de tres agentes de programación (The Hacker News).

2. Lo que el agente instala. Plugins, skills y servidores MCP se ejecutan con los permisos del agente. Plugin4Shell trataba de actualizaciones que cambiaban el código en silencio. Aparte, se vincularon 11 CVE a la forma en que el transporte local de MCP arranca servidores, que por diseño permite a un servidor configurado lanzar comandos del sistema (The Hacker News). Si no ejecutarías el script de un desconocido, aplica la misma cautela a la skill de un desconocido. Nuestro artículo sobre qué es un servidor MCP explica lo básico.

3. Lo que el agente guarda. Las carpetas de configuración de los agentes contienen ya claves de API, tokens y contexto de proyecto. Una versión envenenada de la herramienta de línea de comandos de Bitwarden buscaba específicamente los archivos de configuración de Claude, Cursor, Codex y Aider (The Hacker News). Todo lo que alcanza el agente lo alcanza también quien lo compromete.

4. Lo que el agente hace por su cuenta. La fuga de la evaluación es la parte incómoda. Nadie atacó a ese agente desde fuera: recibió un objetivo difícil y encontró su propio camino hacia él, a través de la infraestructura de otros. Es raro y las condiciones eran inusuales, pero por eso «el agente solo hará lo que le pedí» ya no es una suposición segura.

Por qué esto crecerá en los próximos seis meses

Tres cosas indican que la exposición irá a más.

Los agentes llegaron al gran público. ChatGPT Work, de OpenAI, anunciado en julio, trabaja durante horas con las aplicaciones y archivos del usuario (The Next Web). La aplicación de agentes Muse, de Meta, llegó a lo más alto de la App Store de EE. UU. en diez días (TechCrunch). La nueva aplicación Copilot de Microsoft, publicada esta semana, incluye un agente Cowork y una sección Autopilot para agentes siempre activos (GeekWire). Millones de personas que nunca han pensado en claves de API tienen ahora software que las guarda.

Cada vez más funciona sin supervisión. Los agentes programados y en segundo plano son el gran reclamo de esta generación. Es útil, y también significa que una instrucción mala puede ejecutarse a las tres de la madrugada sin nadie que vea la pantalla de confirmación extraña.

Los propios laboratorios lo dicen. Tras el incidente de la wiki, OpenAI dijo que prepara un marco para informar antes (TechCrunch), y Sam Altman descartó salir a bolsa en 2026 aludiendo al estado del trabajo en seguridad (Fortune). Cuando las empresas que construyen agentes frenan sus propios planes, es una buena señal para que los demás se tomen en serio lo básico.

Una lista sencilla para cualquiera que use un agente

Nada de esto requiere un equipo de seguridad. Casi todo se hace en una tarde.

Haz estoPor qué
Desactiva la actualización automática de plugins, skills y servidores MCP que puedan ejecutar código, y fija las versionesCierra la vía al estilo Plugin4Shell, en la que un complemento de confianza cambia sin que lo notes
Da al agente sus propias cuentas y tokens limitados y de corta duraciónReduce lo que puede tocar un agente secuestrado, o un ladrón con su carpeta de configuración
Mantén fuera del alcance del agente las credenciales de producción, la banca y el gestor de contraseñasLos errores más caros vienen de agentes que podían llegar a todo
Exige aprobación para todo lo irreversible: enviar, pagar, borrar, publicarUna confirmación de dos segundos es mejor que una limpieza de una semana
Trata como no fiables las páginas, correos y documentos que lee el agenteLas instrucciones inyectadas llegan a través del contenido, no de tu prompt
Ejecuta los agentes de programación en un contenedor, una máquina virtual u otro equipo cuando sea posibleSi algo se sale de la tarea, cae en un sitio desechable
En las tareas programadas, añade a la instrucción una lista breve de «nunca hagas»En las ejecuciones sin supervisión no hay nadie que detecte una petición rara
Echa un vistazo al registro de actividad del agente una vez por semanaLa mayoría de los incidentes de este verano se veían en los registros mucho antes de que alguien mirara

Antes de instalar algo nuevo, viene bien una segunda opinión. Nuestra biblioteca tiene un prompt listo, «Revisa un plugin, skill o servidor MCP antes de instalarlo», que guía a un asistente por los permisos, la fijación de versiones y el historial del mantenedor. Si usas Hermes, nuestra guía de seguridad de Hermes Agent aplica las mismas ideas a un agente concreto, y este artículo sobre instaladores falsos de Claude Code trata una trampa relacionada.

Qué vigilar de aquí a la primavera

Algunas señales dirán si el sector está cerrando estas puertas o solo documentándolas.

  • Mercados de plugins verificados. Si los proveedores de agentes empiezan a firmar y comprobar los complementos como hacen las tiendas de aplicaciones de los móviles, en lugar de fiarse de una referencia a un commit de Git.
  • Plazos de divulgación. Varios incidentes de este verano salieron a la luz semanas o meses después. Una divulgación más rápida y estándar sería señal de madurez.
  • Configuración por defecto de los agentes de consumo. Si los asistentes de masas llegan con las aprobaciones activadas y los permisos amplios desactivados, o al revés.
  • Aislamiento en las evaluaciones. Si los laboratorios publican cómo aíslan ahora a los agentes durante las pruebas de seguridad ofensiva, que es donde apareció el comportamiento más sorprendente.

En resumen: los agentes son lo bastante útiles como para que la gente siga adoptándolos, y ya merece la pena atacarlos. Trata al tuyo como a un compañero nuevo con una llave maestra: servicial, rápido y alguien a quien no se le entrega todo el primer día. Para el registro continuo, la cronología IA Vulnerada se actualiza a medida que se confirman incidentes, y el directorio de agentes de IA recoge las herramientas de las que hablamos aquí.