Microsoft представила MAI-Cyber-1-Flash — свою першу модель штучного інтелекту, спеціально розроблену для завдань кібербезпеки. Модель працює виключно всередині MDASH — мультимодальної системи ідентифікації та усунення вразливостей. Згідно з анонсом Microsoft, конфігурація MDASH з MAI-Cyber-1-Flash та GPT-5.4 набрала 95,95% у бенчмарку CyberGym, при цьому вартість роботи системи знизилася на 50% порівняно з попередньою комбінацією моделей. Доступ обмежений схваленими клієнтами MDASH через закритий попередній перегляд Azure AI Foundry.
Архітектура та принцип маршрутизації
Згідно з карткою моделі, MAI-Cyber-1-Flash є розрідженим трансформером на основі архітектури Mixture-of-Experts (MoE) зі 137 мільярдами параметрів, з яких одночасно активні лише 5 мільярдів. Контекстне вікно становить 256 000 токенів. Модель є спеціалізованою доробкою MAI-Code-1-Flash для завдань кібербезпеки, а та, своєю чергою, була створена на основі проміжного чекпоінта MAI-Thinking-1.
Ключова технічна ідея — маршрутизація завдань. MAI-Cyber-1-Flash призначена для оброблення до 90% завдань MDASH, тоді як GPT-5.4 підключається лише для найскладніших 10%. За даними картки моделі, нова конфігурація замінила 80% раніше використаних моделей у системі. Як зазначив Тесу Кім, віцепрезидент Microsoft з агентної безпеки, описуючи MDASH у червні: «Модель — це один із вхідних елементів, система навколо неї — це продукт».
Що насправді вимірюють бенчмарки
Заявлені 95,95% — це результат системи MDASH у зв’язці MAI-Cyber-1-Flash та GPT-5.4, а не самостійний показник нової моделі. Це принципова відмінність, яку легко випустити з уваги.
CyberGym Level 1 — це тест на відтворення відомих вразливостей: агенту надається опис вразливості та не оновлений патчами вихідний код, після чого перевіряється, чи здатен він створити робочий proof-of-concept. Бенчмарк не вимірює здатність виявляти невідомі вразливості і не перевіряє коректність згенерованих патчів.
Додаткову обережність під час інтерпретації результатів вимагають кілька обставин:
- Відсутність у публічному лідерборді. Станом на 28 липня 2026 року публічна таблиця CyberGym і надалі показувала попередній результат Microsoft — 88,4% від 12 травня. Не уточнюється, чи була нова оцінка взагалі подана для розміщення.
- Некоректність порівняння з червневим результатом. Раніше Microsoft повідомляла про 96,55% для MDASH, однак той результат зараховував будь-який збій, включно з нецільовими вразливостями. Липневі матеріали не розкривають, чи застосовувався той самий критерій для 95,95%, тому порівнювати ці два числа як динаміку некоректно.
- Непрозорість економії. Заявлене зниження вартості на 50% визначено щодо попередньої найкращої конфігурації MDASH (GPT-5.4, GPT-5.4 mini, GPT-5.3 Codex). Водночас Microsoft не розкрила обсяг споживання токенів, кількість викликів, затримки, розподіл завдань або обчислювальних ресурсів — відтворити чи нормалізувати цю цифру неможливо.
Результати поза межами CyberGym
Картка моделі містить результати MAI-Cyber-1-Flash під спрощеною термінальною оболонкою (без повної системи MDASH), які дають більш стриману картину:
- CVEBench — 0,314
- CyberSecEval4 (аналіз загроз) — 0,553
- Тест на аналіз зловмисного ПЗ — 0,33
- CRSBench (POV=1200) — 0,651
- ExploitGym (ядро, користувацький простір, браузер) — нуль за всіма категоріями
ExploitGym вимагає від агента перетворити відомі вразливості та вхідні дані, що спричиняють збій, на робочі експлойти для виконання коду. Нульові результати в усіх категоріях показують, що модель поки не здатна розв’язувати завдання розроблення експлойтів — суттєве обмеження, яке варто враховувати під час оцінки загальної зрілості технології.
Microsoft зазначила, що все тестування проводилося в мережевому ізольованому середовищі без доступу до продуктивних систем, інтернету чи зовнішніх сервісів. Картка моделі також містить попередження: згенерований текст і код можуть бути неточними або неповними та потребують перевірки перед використанням у критичних сценаріях.
Місце в стратегії Microsoft: Project Perception
Управління вразливостями через MAI-Cyber-1-Flash усередині MDASH — перший оголошений сценарій для Project Perception, ширшої системи координації захисних агентів безпеки. Згідно з анонсом Microsoft, публічний попередній перегляд Project Perception запланований на 3 серпня, з подальшим розширенням моделі на додаткові робочі процеси безпеки поза межами роботи з вразливостями.
Практичні висновки
Для організацій, які вже використовують MDASH, нова конфігурація потенційно цікава зниженням витрат за зіставної якості — але до появи незалежних підтверджень заявлені цифри залишаються твердженнями вендора. Для решти учасників ринку MAI-Cyber-1-Flash наразі недоступна: модель не пропонується як самостійний продукт або через публічний API.
Головний висновок із цього релізу — не конкретні відсотки, а архітектурний підхід: Microsoft робить ставку на маршрутизацію між спеціалізованою компактною моделлю та потужною універсальною, оптимізуючи співвідношення вартості й якості на рівні всієї системи. Водночас нульові результати в ExploitGym і помірні показники в інших бенчмарках без оболонки MDASH підкреслюють, що цінність створює саме система, а не модель як така. Організаціям, які оцінюють AI-інструменти для управління вразливостями, варто запитувати у вендорів не лише заголовкові бенчмарки, а й методологію оцінки, умови тестування та результати на завданнях, наближених до реальних сценаріїв експлуатації.