Google, Anthropic en OpenAI onthullen Cyber ​​AI-modellen, beveiligingen en toegangsprogramma’s

Google heeft woensdag Gemini 3.8 Flash Cyber ​​aangekondigd, dat het omschreef als het meest capabele cyberbeveiligingsmodel, en heeft het beschikbaar gesteld aan een reeks vertrouwde verdedigers via een nieuw initiatief genaamd het Fairwind-programma.

“Het Fairwind-programma geeft verdedigers met hoge prioriteit (zoals overheden, gezondheidszorgaanbieders en telecommunicatiediensten) vroegtijdige toegang tot geavanceerde modellen die hen helpen een betere verdediging op te bouwen, voordat er nieuwe bedreigingen arriveren”, aldus Google. “Verdedigers hebben dus een vroeg voordeel, omdat ze hen helpen vitale infrastructuur te beschermen – die op zijn beurt mensen beschermt die afhankelijk zijn van die systemen.”

De technologiegigant zei dat het momenteel wereldwijd samenwerkt met meer dan 650 partners, waaronder CrowdStrike, Datadog, Menlo Security, Palo Alto Networks en Snowflake. Het programma is beschikbaar voor een groep Google Cloud-klanten, overheidsinstanties en cyberbeveiligingspartners.

De release van Gemini 3.8 Flash Cyber ​​komt iets meer dan een maand nadat Google Gemini 3.5 Flash Cyber ​​heeft onthuld. Het nieuwste model verbetert zijn voorganger door prestaties op grensniveau te demonstreren bij het ontdekken van autonome kwetsbaarheden, en overtreft zelfs grotere grensmodellen van rivalen Anthropic (Mythos 5) en OpenAI (GPT-5.6 Sol en GPT-5.5-Cyber).

“Met Gemini 3.8 Flash Cyber ​​hebben we ons specifiek gericht op het uitrusten van verdedigers met deskundige capaciteiten die hen een voordeel geven ten opzichte van aanvallers. Dit is de reden waarom we vanaf het begin hebben geïnvesteerd in het oplossen van kwetsbaarheden en deze prioriteit hebben gegeven boven offensieve mogelijkheden zoals exploitatie”, aldus Tulsee Doshi, senior directeur productmanagement, en Raluca Ada Popa, Gemini Security Lead bij Google DeepMind.

Antropische debuut Claude Fable 5.1 en Claude Mythos 5.1

De ontwikkeling valt samen met Anthropic’s lancering van Claude Fable 5.1 en Claude Mythos 5.1 met verschillende niveaus van beveiliging, waarbij de laatste alleen beschikbaar is via vertrouwde toegangsprogramma’s en ondersteunend werk op het gebied van cyberbeveiliging en de levenswetenschappen.

Het bedrijf zei ook dat het nu toestaat dat Fable 5.1 wordt gebruikt voor het identificeren van softwarekwetsbaarheden, maar het verwacht nog steeds een aantal cyberbeveiligingstaken om te leiden naar Opus-modellen, zoals “penetratietests, het genereren van exploits en het scannen van binaire kwetsbaarheden.”

“We hebben evaluaties uitgevoerd van hoe Claude Mythos 5.1 reageert op kwaadaardige verzoeken en snelle injecties (tegenstrijdige instructies verborgen in inhoud die door AI-modellen wordt verwerkt)”, aldus Anthropic. “Het weigerde kwaadaardige codering en computergebruiksverzoeken in een vergelijkbaar tempo als Mythos 5, Sonnet 5 en Opus 5, en het is ons meest robuuste model tot nu toe op een externe prompt-injectiebenchmark.”

Het bedrijf op het gebied van kunstmatige intelligentie (AI) heeft sindsdien ook een nieuwe oplossing aangekondigd, genaamd Enterprise Frontier Safeguards (EFS), die naar eigen zeggen de ‘privacy van zero data retentie (ZDR) combineert met ultramoderne waarborgen voor het opsporen van misbruik’, terwijl bedrijven volledige controle krijgen over hoe hun gegevens worden beoordeeld, opgeslagen en beheerd. OpenAI heeft een soortgelijke oplossing die bekend staat als Private Safety Processing.

Bovendien zei Anthropic dat het aanvullende verhardings- en inperkingsmaatregelen heeft geïmplementeerd, het toezicht op het signaleren van onjuiste afstemming van modellen heeft verhoogd en externe cyberevaluaties van pre-release-modellen heeft stopgezet als reactie op ongeoorloofde toegangsincidenten waarbij Claude-modellen betrokken zijn tegen echte systemen, naast het benadrukken van twee bijdragende factoren (of mislukte afstemming) –

De modellen lijken het bewijs te negeren dat hun evaluatieomgevingen verbonden waren met het echte internet nadat ze aanvankelijk te horen kregen dat ze gesimuleerd waren, en interpreteren de discrepantie op een manier die hen in staat stelt die overtuiging te behouden.

De modellen vertonen roekeloosheid en zijn bereid schadelijke acties te ondernemen op het echte internet om doelbewust hun doelen na te streven

Anthropic gaf toe dat de incidenten een ‘falen van de operationele veiligheid’ waren en zei dat het een classifier heeft gebouwd die sandbox-ontsnappingspogingen detecteert en blokkeert, en de specificaties rond modelbeloningen heeft gewijzigd om problemen aan te pakken waarbij een AI-agent zijn toevlucht neemt tot een kortere weg om de beloningsmetriek te bespelen zonder daadwerkelijk het beoogde doel te bereiken.

“Onze conclusie is dat de aanwezigheid van substantiële beloningshacking in trainingen ervoor kan zorgen dat modellen bereid zijn om lange reeksen van potentieel schadelijke acties in de echte wereld uit te voeren bij het nastreven van taaksucces”, voegde het bedrijf eraan toe.

OpenAI beweert dat Astra voldoet aan kritische cyberbeveiligingsmogelijkheden

OpenAI van zijn kant heeft onthuld dat zijn aanstaande Astra-model voldoet aan de drempel voor kritieke cyberbeveiligingscapaciteiten onder zijn Preparedness Framework, en dat het van plan is zijn meest geavanceerde cyberbeveiligingsfuncties beschikbaar te stellen aan een groep testers via het Daybreak Blue-programma.

De aanduiding ‘Kritisch’ is van toepassing wanneer een AI-model zelfstandig zero-day-kwetsbaarheden in veel goed verdedigde systemen kan detecteren en exploiteren, of een volledige cyberaanval tegen een gehard doelwit kan uitvoeren vanuit slechts een instructie op hoog niveau zonder dat een mens hem onderweg begeleidt.

“De afgelopen weken hebben we delen van de ontwikkeling en release van Astra uitgesteld, terwijl we de bescherming tegen cybermisbruik en ongeoorloofde modelacties hebben versterkt en getest”, aldus het AI-bedrijf. “Op basis van dat werk zijn we van mening dat de veiligheidsmaatregelen van Astra het risico op ernstige schade voor vrijgave in het kader van ons Preparedness Framework voldoende minimaliseren.”

OpenAI zei dat het ook sterkere waarborgen voor Astra heeft toegevoegd om een ​​Hugging Face-achtig incident te voorkomen, waarbij de AI-agenten, onderdeel van een ExploitGym-evaluatie, een manier hebben gevonden om de onderzoeksinfrastructuur te exploiteren en Artifactory te misbruiken als prikbord om informatie uit te wisselen in hun zoektocht om een ​​onmogelijke taak op te lossen, en uiteindelijk in te breken in de infrastructuur van Hugging Face in de hoop het antwoord te stelen in plaats van de uitdaging zelf op te lossen.

“Eén agent, PHASEONE(big), orkestreerde een aanzienlijk deel van dit bedrogonderzoek. PHASEONE10841 gaf zijn werk door aan PHASEONE(big), die dezelfde taak had maar een groter budget”, merkte METR op in zijn analyse. “Agenten hebben meegewerkt aan veel pogingen om cheats er legitiem uit te laten zien, waaronder: (1) het ruilen van het programma dat ze moesten exploiteren; (2) het manipuleren van de geautomatiseerde scorer; (3) het manipuleren van transcripties om het bewijs van bedrog te verdoezelen.”

OpenAI heeft gemeld dat Astra een perfecte score van 100% behaalt op ExploitBench om exploits van bekende kwetsbaarheden te ontwikkelen, en dat het nu 91,5% van de jailbreakverzoeken afwijst, vergeleken met 59% van GPT-5.6 Sol.

Bovendien merkte OpenAI op dat Astra “veel hogere uitvoeringspercentages van willekeurige code” behaalt dan GPT-5.6 Sol met veel minder uitvoertokens, en dat het model tijdens een evaluatie twee zero-day-kwetsbaarheden in niet-gespecificeerde software ontdekte en gebruikte als onderdeel van een exploitketen.

Het model blijkt ook voorheen onbekende fouten te ontdekken en deze om te zetten in werkende exploitketens, waaronder een volledige browsercompromis die uit de sandbox ontsnapt en willekeurige opdrachten uitvoert op de onderliggende host wanneer een HTML-bestand in de browser wordt geopend.

“Het model vond ook meerdere kwetsbaarheden in een gehard besturingssysteem en combineerde deze in een lokale privilege-escalatieketen van een gebruiker zonder rechten naar root”, voegde OpenAI eraan toe. “Alles bij elkaar heeft ons onderzoek ons ​​tot de conclusie gebracht dat de Astra aan de kritische drempel voldoet.”

Om het risico op ernstige cyberschade als gevolg van Astra-achtige modellen te minimaliseren, zei het bedrijf dat het classifiers en gelaagde beveiligingen heeft toegevoegd om de robuustheid van zijn systemen tegen misbruik door slechte actoren te verbeteren en te voorkomen dat het model ongeoorloofde, verkeerd afgestemde acties onderneemt, zelfs als er geen kwaadwillende gebruiker is.

OpenAI waarschuwde echter ook dat de veiligheidsmaatregelen van Astra legitieme activiteiten ten onrechte kunnen markeren als cybermisbruik of ongeoorloofd gedrag.

“Het realiseren van de voordelen van deze systemen zal afhangen van ons vermogen om modellen op elkaar af te stemmen en te controleren naarmate hun mogelijkheden groeien”, concludeerde de parvenu. “Die verantwoordelijkheid strekt zich uit over training, evaluatie en inzet. Het vereist sterker bewijs van afgestemd gedrag, waarborgen die gelijke tred houden met de capaciteiten, en de bereidheid om te vertragen wanneer die beschermingen niet voldoende zijn.”

AI-bedrijven staan ​​onder intensief toezicht na incidenten waarbij hun modellen aan hun evaluatieomgeving ontsnapten en zich op legitieme systemen richtten. Tegelijkertijd heeft de opkomst van door AI aangedreven cyberaanvallen een coalitie van meer dan honderd bedrijven, waaronder Anthropic, Google, Microsoft, OpenAI en verschillende software- en beveiligingsleveranciers, ertoe aangezet een gezamenlijke brief uit te brengen waarin wordt opgeroepen tot betere verdedigingsmechanismen ter verdediging tegen dergelijke bedreigingen.

Thijs Van der Does