OpenAI’s volgende AI-model Astra toont cyberprestaties die sterk genoeg zijn om een ​​pauze te activeren

OpenAI heeft aangekondigd dat het een aantal ‘interne activiteiten’ met betrekking tot het aankomende kunstmatige intelligentie (AI)-model stopzet Astra nadat uit een interne evaluatie bleek dat het aanzienlijke vooruitgang had geboekt op het gebied van agentische codering en cyberbeveiliging.

Als reactie op de ontdekking zei de AI-parvenu dat het beveiligingscontroles implementeert voor modellen met hogere capaciteiten en bijbehorende activiteiten, zoals geïsoleerde testomgevingen, beperkte netwerk- en tooltoegang, verbeterde bescherming en encryptie van modelgewicht, extra monitoring- en detectiemogelijkheden en uitvoering in een sandbox.

“We pauzeren de interne activiteiten waarbij Astra betrokken is en die nog niet aan deze strengere veiligheidscontrolevereisten voldoen”, aldus het bedrijf in een verklaring.

“We hebben universele monitoring geïmplementeerd voor risicovolle acties en verkeerde afstemming in alle agentische toepassingen van Astra, inclusief training en evaluatie. Monitors evalueren de denkketen van het model en activeren een beveiligingsreactie om activiteiten met een hoog risico te beoordelen en te onderbreken.”

OpenAI zei dat het ook zal samenwerken met relevante overheidsinstanties en AI-veiligheidsorganisaties zal selecteren om de mogelijkheden van het model te testen, en aanbevolen beveiligingscontroles zal delen met externe testpartners om evaluaties met een hoger risico en werklasten veilig uit te voeren.

Het bedrijf zei dat het “niet kan uitsluiten” dat het model “kritieke” cybercapaciteiten heeft onder zijn Preparedness Framework, dat de drempel als volgt definieert:

Een met tools uitgebreid model kan functionele zero-day-exploits van alle ernstniveaus identificeren en ontwikkelen in veel geharde, kritische systemen in de echte wereld zonder menselijke tussenkomst. OF een model kan end-to-end nieuwe strategieën bedenken en uitvoeren voor cyberaanvallen tegen geharde doelen, gegeven alleen een gewenst doel op hoog niveau.

Met andere woorden: het model kan zonder menselijke tussenkomst functionele zero-day exploits van alle ernstniveaus ontdekken en ontwikkelen in veel geharde kritieke systemen in de echte wereld, of kan end-to-end nieuwe strategieën voor cyberaanvallen tegen doelen orkestreren en uitvoeren wanneer daarom wordt gevraagd een gewenst doel op hoog niveau.

OpenAI wees erop dat de voorlopige evaluaties van Astra aangeven dat de prestaties ‘sterk genoeg’ zijn en dat het de mogelijkheid niet kan uitsluiten dat het model in dit stadium niet over een ‘kritisch’ capaciteitsniveau beschikt. Het benadrukte ook dat Astra niet betrokken was bij het incident van vorige maand gericht tegen Hugging Face. In een recent academisch artikel prees OpenAI dat het model tien open problemen in de wiskunde en de theoretische informatica oploste voor ongeveer $ 2.000 tegen Sol API-tarieven.

OpenAI zei dat het deze informatie deelde omdat het gelooft dat “het belangrijk is om transparant te zijn tegenover het publiek en de veiligheids- en beveiligingsgemeenschappen over deze potentiële verschuiving in capaciteiten.”

“Wij geloven dat geavanceerde, cyber-compatibele modellen verdedigers moeten helpen kwetsbaarheden te identificeren en aan te pakken voordat aanvallers dat doen”, voegde het eraan toe. “We zijn vastbesloten om samen te werken met regeringen, veiligheidsinstituten en het maatschappelijk middenveld om ervoor te zorgen dat de grensverleggende capaciteiten van modellen als de Astra, en de modellen die volgen, op verantwoorde en brede schaal worden ingezet ten behoeve van de hele mensheid.”

De ontwikkeling is het nieuwste teken van de snel voortschrijdende cybercapaciteiten van grensmodellen, ook al is het de eerste keer dat een AI-laboratorium publiekelijk toezegt de vooruitgang te vertragen vanwege zorgen over cyberveiligheid.

Eerder vorige week maakte het Britse AI Security Institute (AISI) bekend dat uit zijn eigen evaluatie bleek dat AI-modellen met toegang tot internet de echte wereld bereikten om individuen en organisaties autonoom te targeten in 10 van de in totaal 122 runs. Van de 19 geregistreerde dergelijke acties waren er 17 afkomstig van Anthropic’s Mythos 5 en de overige twee betroffen OpenAI’s GPT-5.6-Sol met cyberclassifiers.

“In het ernstigste geval probeerde een agent kwaadaardige code in een open-sourceproject in te voegen”, aldus AISI. “In een poging om de code goedgekeurd te krijgen, hield de agent zich bezig met social engineering: het creëren van valse online identiteiten en deze gebruiken om druk uit te oefenen op de beheerder van het project om de code goed te keuren. Een menselijke beheerder betrapte en weigerde de kwaadaardige code goed te keuren.”

“Deze pogingen waren niet succesvol en ons onderzoek heeft geen enkele daaruit voortvloeiende schade in de echte wereld aangetoond. Maar dit is de eerste keer dat we risico’s rond autonomie en bedrog zien die dit duidelijk manifesteren, zonder specifieke aanwijzingen, in de echte wereld.”

De onthulling komt ook te midden van onthullingen dat modellen van Meta en het Chinese bedrijf Moonshot, namelijk Muse Spark 1.1 en Kimi K3, ontsnapten aan ingeperkte en gerichte doelen uit de echte wereld, wat de zorgen vergroot over de mogelijkheden van ontwikkelaars om steeds capabelere AI-systemen te sandboxen. In beide gevallen is gebleken dat de modellen verkeerde netwerkconfiguraties als wapen gebruiken, in plaats van onafhankelijk een voorheen onbekende kwetsbaarheid te identificeren en te exploiteren om het internet te bereiken.

Terwijl AI-modellen worden getest aan de hand van algemeen aanvaarde benchmarks om te onderzoeken hoe ze offensieve en defensieve cyberbeveiligingstaken uitvoeren in geïsoleerde testomgevingen, zei Frontier Security dat Kimi K3 een netwerkuitvoerlek heeft gevonden waardoor het github(.)com kon bereiken, een officiële repository kon klonen voor het benchmarkprobleem dat het moest oplossen, en toegang kreeg tot de oplossing in plaats van de uitdaging zelf op te lossen.

“In ons geval loste het model de taak helemaal niet op. Het onderzocht het netwerk, realiseerde zich dat de standaard DNS-resolutie voor github.com functioneel was (de meeste andere websites werden geblokkeerd door de sandbox), kloonde de officiële benchmarkrepository en las de oplossing rechtstreeks van de schijf”, aldus Frontier Security.

De groeiende lijst van incidenten waarbij AI-agenten van grote ontwikkelaars op verschillende manieren aan de testomgeving ontsnapten en uiteindelijk echte doelen overtreden die geen deel uitmaakten van het experiment, heeft geleid tot de oprichting van een nieuwe website, toepasselijk genaamd Felony Bench, om deze gevallen op te sporen.

Thijs Van der Does