Mastodon Mastodon Mastodon Mastodon

Як Microsoft інтегрує MAI-Cyber-1-Flash у MDASH для керування вразливостями

Photo of author

CyberSecureFox Editorial Team

Опубліковано:

Microsoft представила MAI-Cyber-1-Flash — свою першу модель штучного інтелекту, спеціально розроблену для завдань кібербезпеки. Модель працює виключно всередині MDASH — мультимодальної системи ідентифікації та усунення вразливостей. Згідно з анонсом Microsoft, конфігурація MDASH з MAI-Cyber-1-Flash та GPT-5.4 набрала 95,95% у бенчмарку CyberGym, при цьому вартість роботи системи знизилася на 50% порівняно з попередньою комбінацією моделей. Доступ обмежений схваленими клієнтами MDASH через закритий попередній перегляд Azure AI Foundry.

Архітектура та принцип маршрутизації

Згідно з карткою моделі, MAI-Cyber-1-Flash є розрідженим трансформером на основі архітектури Mixture-of-Experts (MoE) зі 137 мільярдами параметрів, з яких одночасно активні лише 5 мільярдів. Контекстне вікно становить 256 000 токенів. Модель є спеціалізованою доробкою MAI-Code-1-Flash для завдань кібербезпеки, а та, своєю чергою, була створена на основі проміжного чекпоінта MAI-Thinking-1.

Ключова технічна ідея — маршрутизація завдань. MAI-Cyber-1-Flash призначена для оброблення до 90% завдань MDASH, тоді як GPT-5.4 підключається лише для найскладніших 10%. За даними картки моделі, нова конфігурація замінила 80% раніше використаних моделей у системі. Як зазначив Тесу Кім, віцепрезидент Microsoft з агентної безпеки, описуючи MDASH у червні: «Модель — це один із вхідних елементів, система навколо неї — це продукт».

Що насправді вимірюють бенчмарки

Заявлені 95,95% — це результат системи MDASH у зв’язці MAI-Cyber-1-Flash та GPT-5.4, а не самостійний показник нової моделі. Це принципова відмінність, яку легко випустити з уваги.

CyberGym Level 1 — це тест на відтворення відомих вразливостей: агенту надається опис вразливості та не оновлений патчами вихідний код, після чого перевіряється, чи здатен він створити робочий proof-of-concept. Бенчмарк не вимірює здатність виявляти невідомі вразливості і не перевіряє коректність згенерованих патчів.

Додаткову обережність під час інтерпретації результатів вимагають кілька обставин:

  • Відсутність у публічному лідерборді. Станом на 28 липня 2026 року публічна таблиця CyberGym і надалі показувала попередній результат Microsoft — 88,4% від 12 травня. Не уточнюється, чи була нова оцінка взагалі подана для розміщення.
  • Некоректність порівняння з червневим результатом. Раніше Microsoft повідомляла про 96,55% для MDASH, однак той результат зараховував будь-який збій, включно з нецільовими вразливостями. Липневі матеріали не розкривають, чи застосовувався той самий критерій для 95,95%, тому порівнювати ці два числа як динаміку некоректно.
  • Непрозорість економії. Заявлене зниження вартості на 50% визначено щодо попередньої найкращої конфігурації MDASH (GPT-5.4, GPT-5.4 mini, GPT-5.3 Codex). Водночас Microsoft не розкрила обсяг споживання токенів, кількість викликів, затримки, розподіл завдань або обчислювальних ресурсів — відтворити чи нормалізувати цю цифру неможливо.

Результати поза межами CyberGym

Картка моделі містить результати MAI-Cyber-1-Flash під спрощеною термінальною оболонкою (без повної системи MDASH), які дають більш стриману картину:

  • CVEBench — 0,314
  • CyberSecEval4 (аналіз загроз) — 0,553
  • Тест на аналіз зловмисного ПЗ — 0,33
  • CRSBench (POV=1200) — 0,651
  • ExploitGym (ядро, користувацький простір, браузер) — нуль за всіма категоріями

ExploitGym вимагає від агента перетворити відомі вразливості та вхідні дані, що спричиняють збій, на робочі експлойти для виконання коду. Нульові результати в усіх категоріях показують, що модель поки не здатна розв’язувати завдання розроблення експлойтів — суттєве обмеження, яке варто враховувати під час оцінки загальної зрілості технології.

Microsoft зазначила, що все тестування проводилося в мережевому ізольованому середовищі без доступу до продуктивних систем, інтернету чи зовнішніх сервісів. Картка моделі також містить попередження: згенерований текст і код можуть бути неточними або неповними та потребують перевірки перед використанням у критичних сценаріях.

Місце в стратегії Microsoft: Project Perception

Управління вразливостями через MAI-Cyber-1-Flash усередині MDASH — перший оголошений сценарій для Project Perception, ширшої системи координації захисних агентів безпеки. Згідно з анонсом Microsoft, публічний попередній перегляд Project Perception запланований на 3 серпня, з подальшим розширенням моделі на додаткові робочі процеси безпеки поза межами роботи з вразливостями.

Практичні висновки

Для організацій, які вже використовують MDASH, нова конфігурація потенційно цікава зниженням витрат за зіставної якості — але до появи незалежних підтверджень заявлені цифри залишаються твердженнями вендора. Для решти учасників ринку MAI-Cyber-1-Flash наразі недоступна: модель не пропонується як самостійний продукт або через публічний API.

Головний висновок із цього релізу — не конкретні відсотки, а архітектурний підхід: Microsoft робить ставку на маршрутизацію між спеціалізованою компактною моделлю та потужною універсальною, оптимізуючи співвідношення вартості й якості на рівні всієї системи. Водночас нульові результати в ExploitGym і помірні показники в інших бенчмарках без оболонки MDASH підкреслюють, що цінність створює саме система, а не модель як така. Організаціям, які оцінюють AI-інструменти для управління вразливостями, варто запитувати у вендорів не лише заголовкові бенчмарки, а й методологію оцінки, умови тестування та результати на завданнях, наближених до реальних сценаріїв експлуатації.


CyberSecureFox Editorial Team

Редакція CyberSecureFox висвітлює новини кібербезпеки, уразливості, malware-кампанії, ransomware-активність, AI security, cloud security та security advisories вендорів. Матеріали готуються на основі official advisories, даних CVE/NVD, сповіщень CISA, публікацій вендорів і відкритих звітів дослідників. Статті перевіряються перед публікацією та оновлюються за появи нових даних.

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.