Anthropic en OpenAI hebben dinsdag nieuwe modellen aangekondigd, waarbij beide bedrijven op het gebied van kunstmatige intelligentie (AI) opmerken dat ze blijven investeren in het verbeteren van de afstemming om risicovol gedrag te bestrijden.
Opus 5.5 is volgens Anthropic een “grote stap vooruit ten opzichte van Opus 5” en “behaalt de beste scores van elk model tot nu toe op onze geautomatiseerde gedragsaudit, onze afstemmingssuite die Claude test in duizenden gesimuleerde scenario’s.”
Het AI-bedrijf zei dat het minder waarschijnlijk is dan zijn andere recente modellen om moeilijk ongedaan te maken acties uit te voeren of buiten de grenzen te handelen die het heeft gekregen, en voegde eraan toe dat het resistenter is dan Opus 5 om injectie te stimuleren.
In zijn systeemkaart legde Anthropic uit dat het nieuwste model minder afwijkend gedrag vertoonde en minder meewerkte aan misbruik dan enig ander recent Claude-model.
“Er waren ook minder overijverige of destructieve acties nodig dan bij enig ander model dat we hebben getest”, aldus Anthropic. “Regressies waren onder meer het vaker opvolgen van kwaadaardige instructies in de tekst die een gebruiker in zijn eigen prompt plakt, het vaker accepteren van niet-verifieerbare claims van autorisatie en het meer ontwijken van gevoelige vragen dan modellen van de Claude Mythos-klasse.”
Anthropic benadrukte dat Claude Opus 5.5 in 1,5% van de runs probeerde te ontsnappen of te knoeien met een sandbox in de loop van twee evaluaties die zonder beveiliging werden uitgevoerd. Het wees er ook op dat het model, wanneer het tijdens een gesimuleerde beveiligingsoefening duidelijke inloggegevens aan een openbaar pakketregister kreeg, in ongeveer de helft van de gevallen mogelijk schadelijke acties ondernam.
“In een nieuwe evaluatie, ontworpen om de neiging van een model om containmentgrenzen te overschrijden, te testen, probeerde Opus 5.5 ongeveer 85% minder vaak grenzen te omzeilen dan Opus 5 of Claude Mythos 5.1, en elke poging die het deed was van lage ernst en zelfgerapporteerd”, aldus het rapport.
Het bedrijf merkte ook op dat de meeste cyberbeveiligingstaken zullen worden omgeleid naar Opus 4.8, gezien de “sterke cybercapaciteiten” van Opus 5.5.
OpenAI introduceert GPT‑6 Sol en Luna
De release van Opus 5.5 valt samen met OpenAI’s eigen uitbreiding van het GPT-6-universum met GPT-6 Sol en GPT-6 Luna, met als doel de ultramoderne prestaties en afstemming van Astra op meer betaalbare modellen te brengen.
“GPT-6 Sol en Luna bouwen voort op het uitlijningswerk dat is geïntroduceerd met Astra, ons meest uitgelijnde model tot nu toe”, aldus OpenAI. “In onze afstemmingsevaluaties laten zowel Sol als Luna verbeteringen zien ten opzichte van hun GPT-5.6-tegenhangers, waaronder een lager aantal misleidende claims over hun codeerwerk.”
In tests uitgevoerd door het AI-bedrijf probeerde GPT-6 Luna in ongeveer 42% van de runs de beperkingen voor “toegang geweigerd” te omzeilen, tegenover 77% bij zijn voorganger. Het tarief van GPT-6 Sol bedroeg 64%, vergeleken met 68% voor zijn voorganger.
OpenAI zei ook dat het zijn modellen heeft geëvalueerd om te controleren of ze ongeautoriseerde instructies op een gesimuleerd message board hebben gevolgd. Van de runs waarin de modellen het bord vonden, bleek dat GPT-6 Sol in 11% van de gevallen de gespecificeerde ongeoorloofde actie ondernam, vergeleken met 52% voor GPT-5.6 Sol. Noch GPT-6 Luna, noch Astra hebben dergelijke acties ondernomen, voegde het bedrijf eraan toe.
OpenAI laat externe groepen AI-modellen evalueren
De recente golf van cyberveiligheidsincidenten met AI-modellen heeft geleid tot bezorgdheid over de veiligheid en hun vermogen om zonder menselijke controle te opereren, wat de CEO van Anthropic, Dario Amodei, ertoe heeft aangezet om op te roepen tot het versnellen van de vooruitgang van de technologie, om prioriteit te geven aan verantwoorde ontwikkeling en om waarborgen in te bouwen om te voorkomen dat de instrumenten worden misbruikt.
Google heeft sindsdien het DeepMind Institute gelanceerd om de veilige ontwikkeling van kunstmatige algemene intelligentie (AGI) te bevorderen. Demis Hassabis, mede-oprichter en voorzitter van Google DeepMind, heeft een door de VS geleid grensoverschrijdend AI-standaardorgaan voorgesteld om de meest geavanceerde AI-modellen te evalueren.
“Modelbeoordelingen moeten rigoureuze wetenschappelijke evaluaties omvatten van capaciteiten op het gebied van cyberbeveiliging, biologische dreigingen en andere risicovolle domeinen”, aldus Hassabis. “Deze evaluaties zouden regelmatig worden bijgewerkt, misschien elk kwartaal om te beginnen, waarbij verouderde of verzadigde benchmarks worden verouderd en vervangen.”
OpenAI heeft op zijn beurt plannen geschetst om groepen van derden zijn AI-modellen te laten onderzoeken op veiligheidsrisico’s tijdens het proces van training, evaluatie en implementatie, en tegelijkertijd te zorgen voor ‘sterke onafhankelijkheidsmechanismen, wetenschappelijke nauwkeurigheid, robuuste beveiligingspraktijken en duidelijke verantwoordelijkheden’.
Van de onafhankelijke beoordelingen wordt verwacht dat ze betrekking hebben op veiligheidsgevallen (dat wil zeggen afstemming), kritische waarborgen, capaciteitsevaluaties en incidenten bij verkeerde afstemming.
“We zijn toegewijd aan het ondersteunen van onafhankelijke beoordelaars en het vaststellen van duidelijkere, gedeelde internationale normen – zowel via toekomstige wetten als particuliere bestuursinstellingen – voor effectieve beoordelingen door derden”, aldus OpenAI.
“Hoewel het onafhankelijke evaluatie-ecosysteem nog steeds groeit, zullen we het helpen groeien door het ondersteunen van en samenwerken met een diverse gemeenschap van onafhankelijke beoordelaars met diepgaande expertise op het gebied van grensoverschrijdende veiligheidsvraagstukken. Geen enkele derde partij kan of mag urgente grensveiligheidsvragen volledig behandelen. We zullen doelbewust en met de intentie handelen om onze capaciteit te vergroten en het groeiende ecosysteem van derden in staat te stellen zich aan te passen aan de beste praktijken en principes.”