Investigadores de Zenity Labs revelaron una vulnerabilidad de clase CSRF en la herramienta OpenAI ChatGPT Agent Builder, que recibió el nombre en clave AgentForger. Según los investigadores, un solo clic en un enlace especialmente preparado permitía crear, autorizar y poner en marcha un agente de IA autónomo dentro del entorno corporativo de la víctima, sin interacción adicional por parte del usuario. La vulnerabilidad afectaba a organizaciones que utilizaban ChatGPT Workspace Agents con integraciones corporativas conectadas (Outlook, Gmail, Slack, Teams, Google Drive). Según se informa, OpenAI corrigió el problema el 8 de junio de 2026 tras una divulgación responsable. No se ha encontrado ningún boletín de seguridad oficial de OpenAI de acceso público en el momento de la publicación.
Mecanismo de ataque: del parámetro de URL al operador autónomo
Agent Builder es un constructor visual que permite crear flujos de trabajo de varios pasos basados en agentes de IA. OpenAI anunció el fin de soporte de este producto a partir del 30 de noviembre de 2026, recomendando migrar a Agents SDK.
Según Zenity Labs, la raíz del problema residía en que Agent Builder aceptaba el estado de inicialización a través de parámetros de URL, incluidos template_name e initial_assistant_prompt. El punto crítico era que, al cargar la página, el valor del parámetro initial_assistant_prompt no solo se colocaba en el campo de entrada, sino que se enviaba y ejecutaba automáticamente. Esto convertía cualquier instrucción incrustada en la URL en la primera orden que el Builder ejecutaba de inmediato.
El vector de ataque era el siguiente: el atacante generaba un enlace de phishing del tipo:
chatgpt[.]com/agents/studio/new?template_name=[plantilla]&initial_assistant_prompt=[prompt malicioso]
Para explotar con éxito la vulnerabilidad, según los investigadores, debían cumplirse tres condiciones:
- La víctima está autenticada en ChatGPT
- La víctima tiene acceso a Workspace Agents
- Hay al menos un conector vinculado a una aplicación corporativa (Outlook, Gmail, Google Calendar, Google Drive, Slack o Teams)
Cadena de explotación y mecanismo de persistencia
Como se indica en la segunda parte de la investigación, el prompt malicioso transmitido a través de la URL instruía a Builder para ejecutar la siguiente secuencia de acciones:
- Crear un agente basándose en la plantilla «chief-of-staff»
- Conectar todos los conectores disponibles y establecer para cada uno el modo «Never ask», que desactiva las solicitudes de confirmación
- Publicar el agente y configurar una programación de ejecución cada hora, formando así un mecanismo de persistencia
- En cada ejecución, comprobar los mensajes entrantes procedentes de una dirección determinada con un asunto que comience por «TASK», ejecutar las tareas indicadas y enviar los resultados a la dirección del atacante
- Activar el modo Preview Mode para su puesta en marcha inmediata
Un detalle fundamental: Preview Mode, pensado para probar el agente antes de su publicación, según los investigadores, realizaba acciones reales con las cuentas conectadas de la víctima, utilizando las configuraciones de aprobación recién definidas. No se trataba de un «ensayo en seco»: el agente obtenía acceso pleno a los datos corporativos.
Por qué importa: una nueva clase de amenazas para la IA corporativa
AgentForger pone de manifiesto un problema fundamental que los investigadores describen como un fallo de confianza en el agente: la plataforma partía de la premisa de que el usuario había creado, aprobado, programado y puesto en marcha al agente de forma intencionada. No se realizaba ninguna verificación de esa intención.
Una vez desplegado, según Zenity, el agente fraudulento podía funcionar como un operador interno autónomo: realizar tareas de reconocimiento dentro de la organización, extraer documentos de almacenamientos en la nube y recopilar datos sensibles de los mensajeros corporativos. El atacante no necesitaba volver a interactuar con la víctima: cada mensaje con el asunto «TASK» se convertía en una nueva tarea para el agente.
Las organizaciones que hacen un uso intensivo de ChatGPT Workspace Agents con múltiples integraciones a servicios corporativos son las más expuestas. Cuantos más conectores haya conectados, mayor será la superficie de ataque y el volumen de datos accesibles para el agente comprometido.
Un contexto más amplio: infraestructura de IA vulnerable
La investigación AgentForger se enmarca en una tendencia que Zenity Labs viene observando en paralelo: los atacantes explotan activamente vulnerabilidades en infraestructuras de IA autodesplegadas. En particular, se ha observado el abuso de vulnerabilidades en LiteLLM — CVE-2024-6587, CVE-2026-40217 y CVE-2026-35029—, así como de endpoints expuestos de Ollama para tomar el control de infraestructuras de IA y llevar a cabo ataques contra terceros. Los servidores de modelos mal configurados, sin autenticación y accesibles en puertos predecibles, se convierten en cómodos recursos de computación anónimos para operaciones ofensivas.
Recomendaciones prácticas
- Auditoría de los agentes existentes: revise todos los Workspace Agents desplegados en su organización, especialmente los creados con la plantilla «chief-of-staff». Preste atención a los agentes con programación de ejecución y confirmaciones desactivadas
- Revisión de conectores: revise la lista de integraciones de ChatGPT autorizadas con aplicaciones corporativas. Desactive los conectores que no se utilicen: cada uno amplía la superficie de ataque potencial
- Supervisión de reglas de correo: controle los mensajes entrantes con el patrón «TASK» en el asunto dirigidos a empleados que utilizan ChatGPT Workspace
- Planificación de la migración: dado el fin de soporte anunciado de Agent Builder para el 30 de noviembre de 2026, inicie la transición a Agents SDK, evaluando el modelo de seguridad de la nueva herramienta
- Limitación de la ejecución automática: a nivel de políticas de la organización, valore prohibir la creación y publicación automáticas de agentes sin una confirmación explícita y en varios pasos
AgentForger es una demostración clara de cómo una vulnerabilidad web clásica (CSRF), combinada con la ejecución automática de prompts y un sistema de confianza en los agentes, crea un vector de ataque cualitativamente nuevo. Las organizaciones que utilizan ChatGPT Workspace Agents deberían auditar de inmediato los agentes desplegados y las integraciones conectadas y, al planificar la migración a Agents SDK, incorporar requisitos de verificación explícita de las intenciones del usuario al crear y autorizar agentes de IA.