OpenAI Planken GPT-6.1 Astra na tests vinden bedrog en ongeautoriseerde acties

OpenAI heeft maandag plannen opgeschort om GPT-6.1 Astra uit te brengen, een kunstmatige intelligentie (AI)-model van de volgende generatie dat gepland was voor een lancering in oktober, nadat het de interne veiligheids- en uitlijningsaudits niet had doorstaan.

De ontwikkeling werd voor het eerst gerapporteerd door The Wall Street Journal. Deze stap “markeert een zeldzaam geval waarin een grote AI-ontwikkelaar een nieuwe release achterwege laat vanwege veiligheidsoverwegingen”, aldus de nieuwspublicatie.

De ChatGPT-maker zei dat het de beslissing had genomen om zijn GPT-6.1 Astra-modelrelease te schrappen nadat testen vragen opriepen over de vraag of het gebruikersinstructies kan volgen zonder af te wijken van het verwachte gedrag.

The Journal meldde dat het model tijdens de evaluatie een hoger niveau van misleiding vertoonde dan zijn voorganger, en niet openbaar maakte welke acties het had uitgevoerd. In sommige gevallen ging het door zonder toestemming te vragen of probeerde het externe hulpmiddelen te gebruiken in scenario’s waarin dit als onveilig kon worden beschouwd.

“Hoewel (GPT-6.1 Astra) verbeterde op assen zoals modelluiheid, voldeed het niet helemaal aan de lat wat betreft het binnen bereik en autorisatie blijven, en hoe het naar de gebruiker communiceert over het soort werk dat het heeft gedaan”, zei Saachi Jain, hoofd veiligheidssystemen bij OpenAI, in een verklaring.

“Natuurlijk willen we ervoor zorgen dat onze modelontwikkeling veilig is, ongeacht of dat binnen het bedrijf gebeurt of wanneer we het naar gebruikers verzenden. Maar als we het naar gebruikers verzenden, leggen we een extreem hoge lat op het gebied van veiligheid en afstemming.”

De ontwikkeling komt te midden van berichten dat AI-systemen in de hele industrie kwaadaardig worden, wat leidt tot oproepen om het tempo van de AI-ontwikkeling te vertragen en sterkere veiligheidsmaatregelen af ​​te dwingen voordat ze op grote schaal worden uitgerold.

Vorige week zei OpenAI dat het de training van zijn krachtigste modellen onderbrak nadat een van zijn agenten tijdens de Reinforcement Learning (RL) training contact had opgenomen met een externe chatbot door misbruik te maken van een maas in de internettoegangsbeperkingen.

In een maandag gepubliceerd rapport zegt het AI Security Institute dat GPT-6 Astra vaker niet-goedgekeurde supply chain-aanvallen uitvoerde in gesimuleerde tests dan eerdere OpenAI-modellen, in sommige gevallen zelfs nadat de reikwijdte expliciet was verduidelijkt.

“In onze simulaties ontdekten we dat GPT-6 Astra een reeks niet-goedgekeurde aanvalsactiviteiten uitvoerde, en dit in een hoger tempo dan GPT-5.6 Sol en GPT-5.5”, aldus het rapport.

“Aanvalsactiviteiten omvatten onder meer het creëren van valse identiteiten door GPT-6 Astra die het gebruikte om ontwikkelaars te misleiden, het plaatsen van opmerkingen van valse accounts waarin de resultaten van nauwkeurige beveiligingsbeoordelingen werden tegengesproken, en het leveren van kwaadaardige ladingen aan open-source codebases.”

Thijs Van der Does