Microsoft zegt dat nieuw AI-model voor cyberbeveiliging ervoor zorgt dat MDASH 95,95% haalt tegen de helft van de kosten

Microsoft heeft binnenin zijn eerste cybersecurity-specifieke model gelanceerd MDASHhet harnas voor identificatie en herstel van kwetsbaarheden op meerdere modellen.

Het bedrijf zegt dat MDASH, met behulp van MAI-Cyber-1-Flash en GPT-5.4, 95,95% scoorde op CyberGym. Het beweert ook dat de configuratie 50% minder kost dan de huidige beste MDASH-combinatie van GPT-5.4, GPT-5.4 mini en GPT-5.3 Codex. De toegang is beperkt tot goedgekeurde MDASH-klanten via een privépreview van Azure AI Foundry.

MAI-Cyber-1-Flash is ontworpen om tot 90% van de MDASH-taken aan te kunnen, waarbij GPT-5.4 gereserveerd is voor de moeilijkste 10%. Het is alleen beschikbaar binnen MDASH, niet als een zelfstandig openbaar model of een algemene programmeerinterface voor toepassingen.

De hoofdscore is van MDASH met MAI-Cyber-1-Flash naast GPT-5.4, en niet van het nieuwe model zelf. CyberGym Level 1 is een reproductietest met bekende kwetsbaarheid. Het geeft een agent een beschrijving van de kwetsbaarheid en de bijbehorende ongepatchte broncode, en controleert vervolgens of hij een werkend proof of concept kan produceren. Het meet niet de blinde ontdekking van kwetsbaarheden of de juistheid van een gegenereerde patch.

Het openbare klassement van CyberGym vermeldde niet het resultaat van Microsoft van 95,95% toen het werd gecontroleerd op 28 juli 2026. Het vermeldde nog steeds de MDASH-inzending van Microsoft van 12 mei op 88,4%. In het openbare materiaal van Microsoft wordt niet vermeld of het resultaat is ingediend voor vermelding.

Het eerdere MDASH-resultaat van 96,55% van Microsoft lost de vergelijking niet op. In dat cijfer van juni werd elke crash meegeteld, inclusief niet-doelmatige kwetsbaarheden. In de materialen van juli wordt niet vermeld of het resultaat van 95,95% hetzelfde criterium hanteert, zodat de twee scores niet veilig kunnen worden gelezen als een prestatietrend voor en na.

Volgens de modelkaart van Microsoft is MAI-Cyber-1-Flash een schaarse mix van experts-transformator met in totaal 137 miljard parameters, vijf miljard actieve parameters en een contextvenster van 256.000 tokens. Het is een cybersecurity-verfijning van MAI-Code-1-Flash, die is ontwikkeld op basis van een MAI-Thinking-1-controlepunt halverwege de training.

De modelkaart zegt dat de geëvalueerde configuratie 80% van de bestaande modellen van MDASH verving en het gerapporteerde CyberGym-resultaat verhoogde van 88,4% naar 95,95%. Dat cijfer van 80% is het aandeel vervangen modellen. Het afzonderlijke cijfer van 90% is het maximale aantal taken dat Microsoft zegt dat het kleinere model aankan.

Alles bij elkaar wijst het onthulde ontwerp op routing als de centrale technische claim: MAI-Cyber-1-Flash is bedoeld om de meeste taken uit te voeren, GPT-5.4 neemt de moeilijkste rest op zich, en Microsoft rapporteert de uitkomst op MDASH-systeemniveau.

De lanceringsaankondiging van Microsoft definieert de besparing van 50% ten opzichte van de huidige beste MDASH-modelmix van GPT-5.4, GPT-5.4 mini en GPT-5.3 Codex. Op de productpagina wordt afzonderlijk beschreven dat het systeem “vergelijkbare prestaties levert tegen 50% van de kosten van toonaangevende modellen.” De aankondiging en de modelkaart onthullen niet het tokengebruik, het belvolume, de latentie, de taakmix of de computertoewijzing achter die vergelijking, dus het cijfer kan nog niet onafhankelijk worden gereproduceerd of genormaliseerd ten opzichte van andere systemen.

“Het model is één input, het systeem eromheen is het product.”

Taesoo Kim, Microsoft’s vice-president van agentische beveiliging, gebruikte dat onderscheid toen hij in juni MDASH beschreef. Onder een lichtgewicht terminalharnas rapporteert de modelkaart scores van 0,314 op CVEBench, 0,553 op CyberSecEval4-bedreigingsinformatie, 0,33 op de malware-analysetest en 0,651 op CRSBench bij POV = 1200.

Het model scoorde nul in de kernel-, gebruikersruimte- en browsercategorieën van ExploitGym, dat agenten vraagt ​​om aangeleverde kwetsbaarheden en crashende invoer om te zetten in werkende code-uitvoeringsexploits. Deze resultaten komen uit verschillende taken en scoreschalen, dus geen enkele is een op zichzelf staande CyberGym-score voor MAI-Cyber-1-Flash.

Microsoft zei dat alle benchmarktests plaatsvonden in een netwerkgeïsoleerde omgeving zonder toegang tot productiesystemen, het openbare internet of externe diensten. De modelkaart waarschuwt ook dat de gegenereerde tekst en code onnauwkeurig of onvolledig kunnen zijn en vóór vervolggebruik moeten worden beoordeeld.

Beheer van softwarekwetsbaarheden met behulp van MAI-Cyber-1-Flash binnen MDASH is het eerste scenario dat Microsoft heeft aangekondigd voor Project Perception, het bredere systeem voor het coördineren van defensieve beveiligingsagenten. Project Perception zal naar verwachting op 3 augustus in de publieke preview verschijnen, waarbij Microsoft van plan is het model uit te breiden buiten het werk om softwarekwetsbaarheden te verhelpen en ook aanvullende beveiligingsworkflows toe te voegen.

Thijs Van der Does