Microsoft представила MAI-Cyber-1-Flash — свою первую модель искусственного интеллекта, специально разработанную для задач кибербезопасности. Модель работает исключительно внутри MDASH — мультимодельной системы идентификации и устранения уязвимостей. Согласно анонсу Microsoft, конфигурация MDASH с MAI-Cyber-1-Flash и GPT-5.4 набрала 95,95% на бенчмарке CyberGym, при этом стоимость работы системы снизилась на 50% по сравнению с предыдущей комбинацией моделей. Доступ ограничен одобренными клиентами MDASH через закрытый предварительный просмотр Azure AI Foundry.
Архитектура и принцип маршрутизации
Согласно карточке модели, MAI-Cyber-1-Flash представляет собой разреженный трансформер на основе архитектуры Mixture-of-Experts (MoE) со 137 миллиардами параметров, из которых одновременно активны лишь 5 миллиардов. Контекстное окно составляет 256 000 токенов. Модель является специализированной доработкой MAI-Code-1-Flash для задач кибербезопасности, а та, в свою очередь, была создана на основе промежуточного чекпоинта MAI-Thinking-1.
Ключевая техническая идея — маршрутизация задач. MAI-Cyber-1-Flash предназначена для обработки до 90% задач MDASH, тогда как GPT-5.4 подключается только для наиболее сложных 10%. По данным карточки модели, новая конфигурация заменила 80% ранее используемых моделей в системе. Как отметил Тэсу Ким, вице-президент Microsoft по агентной безопасности, описывая MDASH в июне: «Модель — это один из входов, система вокруг неё — это продукт».
Что на самом деле измеряют бенчмарки
Заявленные 95,95% — это результат системы MDASH в связке MAI-Cyber-1-Flash и GPT-5.4, а не самостоятельный показатель новой модели. Это принципиальное различие, которое легко упустить.
CyberGym Level 1 — это тест на воспроизведение известных уязвимостей: агенту предоставляется описание уязвимости и непатченный исходный код, после чего проверяется, может ли он создать работающий proof-of-concept. Бенчмарк не измеряет способность обнаруживать неизвестные уязвимости и не проверяет корректность сгенерированных патчей.
Дополнительную осторожность при интерпретации результатов требуют несколько обстоятельств:
- Отсутствие на публичном лидерборде. По состоянию на 28 июля 2026 года публичная таблица CyberGym по-прежнему показывала предыдущий результат Microsoft — 88,4% от 12 мая. Не уточняется, была ли новая оценка вообще подана для размещения.
- Несопоставимость с июньским результатом. Ранее Microsoft сообщала о 96,55% для MDASH, однако тот результат засчитывал любой сбой, включая нецелевые уязвимости. Июльские материалы не раскрывают, применялся ли тот же критерий для 95,95%, поэтому сравнивать эти два числа как динамику некорректно.
- Непрозрачность экономии. Заявленное снижение стоимости на 50% определено относительно предыдущей лучшей конфигурации MDASH (GPT-5.4, GPT-5.4 mini, GPT-5.3 Codex). Однако Microsoft не раскрыла объём потребления токенов, количество вызовов, задержки, распределение задач или вычислительных ресурсов — воспроизвести или нормализовать эту цифру невозможно.
Результаты за пределами CyberGym
Карточка модели содержит результаты MAI-Cyber-1-Flash под упрощённой терминальной оболочкой (без полной системы MDASH), которые дают более сдержанную картину:
- CVEBench — 0,314
- CyberSecEval4 (анализ угроз) — 0,553
- Тест на анализ вредоносного ПО — 0,33
- CRSBench (POV=1200) — 0,651
- ExploitGym (ядро, пользовательское пространство, браузер) — ноль по всем категориям
ExploitGym требует от агента превратить известные уязвимости и входные данные, вызывающие сбой, в работающие эксплойты для выполнения кода. Нулевые результаты по всем категориям показывают, что модель пока не способна решать задачи разработки эксплойтов — существенное ограничение, которое стоит учитывать при оценке общей зрелости технологии.
Microsoft указала, что всё тестирование проводилось в сетевой изолированной среде без доступа к продуктивным системам, интернету или внешним сервисам. Карточка модели также содержит предупреждение: сгенерированный текст и код могут быть неточными или неполными и требуют проверки перед использованием в критичных сценариях.
Место в стратегии Microsoft: Project Perception
Управление уязвимостями через MAI-Cyber-1-Flash внутри MDASH — первый объявленный сценарий для Project Perception, более широкой системы координации защитных агентов безопасности. Согласно анонсу Microsoft, публичный предварительный просмотр Project Perception запланирован на 3 августа, с последующим расширением модели на дополнительные рабочие процессы безопасности за рамками работы с уязвимостями.
Практические выводы
Для организаций, уже использующих MDASH, новая конфигурация потенциально интересна снижением затрат при сопоставимом качестве — но до появления независимых подтверждений заявленные цифры остаются вендорскими. Для остальных участников рынка MAI-Cyber-1-Flash пока недоступна: модель не предлагается как самостоятельный продукт или через публичный API.
Главный вывод из этого релиза — не конкретные проценты, а архитектурный подход: Microsoft делает ставку на маршрутизацию между специализированной компактной моделью и мощной универсальной, оптимизируя соотношение стоимости и качества на системном уровне. При этом нулевые результаты на ExploitGym и умеренные показатели на других бенчмарках без оболочки MDASH подчёркивают, что ценность создаёт именно система, а не модель сама по себе. Организациям, оценивающим ИИ-инструменты для управления уязвимостями, стоит запрашивать у вендоров не только заголовочные бенчмарки, но и методологию оценки, условия тестирования и результаты на задачах, приближенных к реальным сценариям эксплуатации.