Mastodon Mastodon Mastodon Mastodon

Microsoft выпустила MAI-Cyber-1-Flash — специализированную модель для поиска уязвимостей внутри MDASH

Фото автора

CyberSecureFox Editorial Team

Опубликовано:

Microsoft представила MAI-Cyber-1-Flash — свою первую модель искусственного интеллекта, специально разработанную для задач кибербезопасности. Модель работает исключительно внутри MDASH — мультимодельной системы идентификации и устранения уязвимостей. Согласно анонсу Microsoft, конфигурация MDASH с MAI-Cyber-1-Flash и GPT-5.4 набрала 95,95% на бенчмарке CyberGym, при этом стоимость работы системы снизилась на 50% по сравнению с предыдущей комбинацией моделей. Доступ ограничен одобренными клиентами MDASH через закрытый предварительный просмотр Azure AI Foundry.

Архитектура и принцип маршрутизации

Согласно карточке модели, MAI-Cyber-1-Flash представляет собой разреженный трансформер на основе архитектуры Mixture-of-Experts (MoE) со 137 миллиардами параметров, из которых одновременно активны лишь 5 миллиардов. Контекстное окно составляет 256 000 токенов. Модель является специализированной доработкой MAI-Code-1-Flash для задач кибербезопасности, а та, в свою очередь, была создана на основе промежуточного чекпоинта MAI-Thinking-1.

Ключевая техническая идея — маршрутизация задач. MAI-Cyber-1-Flash предназначена для обработки до 90% задач MDASH, тогда как GPT-5.4 подключается только для наиболее сложных 10%. По данным карточки модели, новая конфигурация заменила 80% ранее используемых моделей в системе. Как отметил Тэсу Ким, вице-президент Microsoft по агентной безопасности, описывая MDASH в июне: «Модель — это один из входов, система вокруг неё — это продукт».

Что на самом деле измеряют бенчмарки

Заявленные 95,95% — это результат системы MDASH в связке MAI-Cyber-1-Flash и GPT-5.4, а не самостоятельный показатель новой модели. Это принципиальное различие, которое легко упустить.

CyberGym Level 1 — это тест на воспроизведение известных уязвимостей: агенту предоставляется описание уязвимости и непатченный исходный код, после чего проверяется, может ли он создать работающий proof-of-concept. Бенчмарк не измеряет способность обнаруживать неизвестные уязвимости и не проверяет корректность сгенерированных патчей.

Дополнительную осторожность при интерпретации результатов требуют несколько обстоятельств:

  • Отсутствие на публичном лидерборде. По состоянию на 28 июля 2026 года публичная таблица CyberGym по-прежнему показывала предыдущий результат Microsoft — 88,4% от 12 мая. Не уточняется, была ли новая оценка вообще подана для размещения.
  • Несопоставимость с июньским результатом. Ранее Microsoft сообщала о 96,55% для MDASH, однако тот результат засчитывал любой сбой, включая нецелевые уязвимости. Июльские материалы не раскрывают, применялся ли тот же критерий для 95,95%, поэтому сравнивать эти два числа как динамику некорректно.
  • Непрозрачность экономии. Заявленное снижение стоимости на 50% определено относительно предыдущей лучшей конфигурации MDASH (GPT-5.4, GPT-5.4 mini, GPT-5.3 Codex). Однако Microsoft не раскрыла объём потребления токенов, количество вызовов, задержки, распределение задач или вычислительных ресурсов — воспроизвести или нормализовать эту цифру невозможно.

Результаты за пределами CyberGym

Карточка модели содержит результаты MAI-Cyber-1-Flash под упрощённой терминальной оболочкой (без полной системы MDASH), которые дают более сдержанную картину:

  • CVEBench — 0,314
  • CyberSecEval4 (анализ угроз) — 0,553
  • Тест на анализ вредоносного ПО — 0,33
  • CRSBench (POV=1200) — 0,651
  • ExploitGym (ядро, пользовательское пространство, браузер) — ноль по всем категориям

ExploitGym требует от агента превратить известные уязвимости и входные данные, вызывающие сбой, в работающие эксплойты для выполнения кода. Нулевые результаты по всем категориям показывают, что модель пока не способна решать задачи разработки эксплойтов — существенное ограничение, которое стоит учитывать при оценке общей зрелости технологии.

Microsoft указала, что всё тестирование проводилось в сетевой изолированной среде без доступа к продуктивным системам, интернету или внешним сервисам. Карточка модели также содержит предупреждение: сгенерированный текст и код могут быть неточными или неполными и требуют проверки перед использованием в критичных сценариях.

Место в стратегии Microsoft: Project Perception

Управление уязвимостями через MAI-Cyber-1-Flash внутри MDASH — первый объявленный сценарий для Project Perception, более широкой системы координации защитных агентов безопасности. Согласно анонсу Microsoft, публичный предварительный просмотр Project Perception запланирован на 3 августа, с последующим расширением модели на дополнительные рабочие процессы безопасности за рамками работы с уязвимостями.

Практические выводы

Для организаций, уже использующих MDASH, новая конфигурация потенциально интересна снижением затрат при сопоставимом качестве — но до появления независимых подтверждений заявленные цифры остаются вендорскими. Для остальных участников рынка MAI-Cyber-1-Flash пока недоступна: модель не предлагается как самостоятельный продукт или через публичный API.

Главный вывод из этого релиза — не конкретные проценты, а архитектурный подход: Microsoft делает ставку на маршрутизацию между специализированной компактной моделью и мощной универсальной, оптимизируя соотношение стоимости и качества на системном уровне. При этом нулевые результаты на ExploitGym и умеренные показатели на других бенчмарках без оболочки MDASH подчёркивают, что ценность создаёт именно система, а не модель сама по себе. Организациям, оценивающим ИИ-инструменты для управления уязвимостями, стоит запрашивать у вендоров не только заголовочные бенчмарки, но и методологию оценки, условия тестирования и результаты на задачах, приближенных к реальным сценариям эксплуатации.


CyberSecureFox Editorial Team

Редакция CyberSecureFox освещает новости кибербезопасности, уязвимости, malware-кампании, ransomware-активность, AI security, cloud security и security advisories вендоров. Материалы готовятся на основе official advisories, данных CVE/NVD, уведомлений CISA, публикаций вендоров и открытых отчётов исследователей. Статьи проверяются перед публикацией и обновляются при появлении новых данных.

Оставьте комментарий

Этот сайт использует Akismet для борьбы со спамом. Узнайте, как обрабатываются ваши данные комментариев.