Mastodon Mastodon Mastodon Mastodon

GPT-5.6-Cyber de OpenAI: nueva IA para búsqueda de vulnerabilidades y exploits

Foto del autor

CyberSecureFox Editorial Team

Publicado:

OpenAI presentó el modelo especializado GPT-5.6-Cyber, diseñado para la búsqueda de vulnerabilidades zero-day, el desarrollo de cadenas de exploits y la respuesta a incidentes. El modelo está disponible a través del nuevo nivel de acceso Daybreak Red para un círculo limitado de socios — Accenture, Cisco, CrowdStrike, Palo Alto Networks y otras grandes empresas del sector de la ciberseguridad. La característica clave es una drástica reducción de las negativas ante solicitudes relacionadas con tareas ofensivas: según un benchmark interno de OpenAI, el modelo satisface el 95% de este tipo de peticiones, mientras que la GPT-5.6 Sol básica solo alcanza el 1,5%. Es el primer intento de un gran desarrollador de IA de crear de forma deliberada un modelo «permisivo» para seguridad ofensiva, lo que plantea serias cuestiones sobre el equilibrio entre defensa y posible abuso.

Arquitectura de acceso y métricas técnicas

GPT-5.6-Cyber se basa en GPT-5.6 Sol y es una evolución del modelo GPT-5.5-Cyber, lanzado, según OpenAI, en junio de 2026. El modelo se distribuye a través del programa Daybreak, puesto en marcha en mayo de 2026 y que incluye dos niveles de acceso:

  • Daybreak Blue: acceso a modelos de propósito general (incluida GPT-5.6 Sol) con restricciones de seguridad adaptadas a tareas defensivas: detección de incidentes, investigaciones, gestión de vulnerabilidades
  • Daybreak Red: acceso a modelos especializados con restricciones mínimas para pruebas de penetración autorizadas, validación de exploits e investigación de vulnerabilidades

Para evaluar el grado de «permisividad» del modelo, OpenAI desarrolló el benchmark interno Advanced Cybersecurity Completion Rate, que mide la proporción de solicitudes completadas en escenarios de desarrollo de cadenas de exploits, bypass de autenticación y escalada de privilegios. Resultados declarados por OpenAI:

  • GPT-5.6-Cyber (Daybreak Red): 95,0%
  • GPT-5.5-Cyber: 57,3%
  • GPT-5.6 Sol (Daybreak Blue): 2,0%
  • GPT-5.6 Sol (sin Daybreak): 1,5%

Según OpenAI, en el benchmark ExploitGym el modelo también superó tanto a GPT-5.6 Sol como a GPT-5.5-Cyber. Sin embargo, es importante tener en cuenta que ambos benchmarks son desarrollos internos de OpenAI y que su metodología no ha sido sometida a validación independiente.

Vulnerabilidades detectadas: qué está confirmado

OpenAI afirma que GPT-5.6-Cyber ha descubierto varias vulnerabilidades reales. La única de ellas que puede verificarse mediante fuentes primarias es CVE-2026-15903 (CVSS 8.8). Se trata de una vulnerabilidad de lectura y escritura fuera de los límites de la memoria asignada en el motor V8 JavaScript, que permite a un atacante remoto ejecutar potencialmente código arbitrario dentro de la sandbox mediante una página HTML especialmente diseñada. Google corrigió la vulnerabilidad a mediados de julio de 2026.

Al mismo tiempo, la atribución del descubrimiento de CVE-2026-15903 concretamente al modelo GPT-5.6-Cyber procede exclusivamente de OpenAI: esta información no se confirma en el boletín de Google. Las declaraciones sobre cientos de otras vulnerabilidades encontradas (en sistemas operativos móviles, bases de datos y kernels de sistemas operativos) tampoco están respaldadas por fuentes independientes, CVE concretos ni nombres de los productos afectados.

Paradoja crítica: encontrar no significa corregir

Es significativo que la propia OpenAI reconozca que GPT-5.6-Cyber es inferior a la GPT-5.6 Sol básica en tareas de ciclo completo: detección de vulnerabilidades en un repositorio, desarrollo de una prueba de concepto funcional y elaboración de un informe de calidad. El motivo es que el modelo genera informes sobre vulnerabilidades más breves y menos detallados.

Esta paradoja se ve respaldada por una investigación independiente de 1Password, que demostró que los modelos de lenguaje actuales son extremadamente poco fiables a la hora de corregir las vulnerabilidades encontradas:

  • Solo el 26,0% de los parches generados eliminaban por completo la vulnerabilidad sin cambiar el comportamiento de la aplicación
  • El 20,1% de los parches eliminaban la vulnerabilidad, pero perjudicaban el funcionamiento de la aplicación
  • El 53,9% de los parches o bien no eliminaban la vulnerabilidad, o introducían una nueva, o ambas cosas a la vez

Esto significa que más de la mitad de las correcciones generadas automáticamente potencialmente amplían la superficie de ataque. Los modelos optimizados para detectar un amplio espectro de vulnerabilidades solo corrigen de forma eficaz un subconjunto reducido de ellas.

Evaluación de riesgos y consecuencias estratégicas

El lanzamiento de GPT-5.6-Cyber configura una nueva categoría de herramientas: modelos «permisivos» para seguridad ofensiva. Esto crea varios niveles de riesgo:

  • Asimetría de acceso. El modelo está disponible para un círculo limitado de grandes empresas. Esto amplía la brecha entre las organizaciones capaces de permitirse una asociación con OpenAI y el resto de actores del mercado
  • Problema de doble uso. OpenAI reconoce abiertamente: «Los modelos con restricciones reducidas conllevan riesgos que van más allá del uso estándar, tanto por abusos como por comportamientos incoherentes»
  • Aceleración de la carrera. Según OpenAI, la IA ya está acortando el tiempo entre la publicación de una vulnerabilidad y la creación de un exploit. La aparición de modelos especializados para el desarrollo de exploits puede acelerar este proceso en ambos bandos

Recomendaciones

Para las organizaciones que han obtenido acceso a GPT-5.6-Cyber a través de Daybreak Red:

  • No confíe en parches generados automáticamente sin verificación manual; a la luz de los datos de 1Password, más de la mitad de estas correcciones son potencialmente peligrosas
  • Utilice el modelo como herramienta de detección y priorización, y no como sustituto de la experiencia en el desarrollo de correcciones
  • Implemente procedimientos de control de acceso al modelo y de auditoría de solicitudes, teniendo en cuenta el alto nivel de «permisividad» (95% de ejecución de solicitudes ofensivas)

Para el resto de organizaciones:

  • Espere una reducción de la ventana entre la divulgación de una vulnerabilidad y la aparición de un exploit funcional; revise los SLA de aplicación de parches endureciéndolos
  • Asegúrese de que Chrome y los navegadores basados en Chromium estén actualizados con el parche para CVE-2026-15903

La aparición de GPT-5.6-Cyber no es solo el lanzamiento de un nuevo producto, sino una señal de cambio de paradigma: el mayor desarrollador de IA crea deliberadamente herramientas para seguridad ofensiva con restricciones mínimas. Las organizaciones deberían centrarse en dos acciones concretas: acelerar el ciclo de aplicación de parches (especialmente para motores de navegador y componentes con CVSS alto) y evaluar de forma crítica cualquier corrección generada por IA antes de desplegarla en entornos de producción.


CyberSecureFox Editorial Team

El equipo editorial de CyberSecureFox cubre noticias de ciberseguridad, vulnerabilidades, campañas de malware, actividad de ransomware, AI security, cloud security y security advisories de proveedores. Los materiales se preparan a partir de official advisories, datos de CVE/NVD, alertas de CISA, publicaciones de proveedores e informes públicos de investigadores. Los artículos se revisan antes de su publicación y se actualizan cuando aparece nueva información.

Deja un comentario

Este sitio usa Akismet para reducir el spam. Aprende cómo se procesan los datos de tus comentarios.