OpenAI heeft woensdag zes nieuwe gevallen van ‘onverwacht of zorgwekkend modelgedrag’ onthuld die de afgelopen zes maanden hebben plaatsgevonden, terwijl het een nieuw raamwerk heeft gedeeld voor het rapporteren, volgen, onderzoeken en openbaar maken van onjuiste modelafstemming in een poging de transparantie te verbeteren.
“Naarmate AI-systemen geavanceerder worden en op grotere schaal worden ingezet, moeten we een bredere en beter geïnformeerde consensus opbouwen over de voortgang van het afstemmingsonderzoek”, aldus OpenAI. “Wij geloven niet dat de AI-industrie de afstemming en monitoring in voldoende mate heeft opgelost om nog veel langer op verantwoorde wijze op maximale snelheid te kunnen blijven schalen.”
“Beslissingen over hoe AI-ontwikkeling de komende maanden en jaren moet verlopen, moeten gebaseerd zijn op bewijsmateriaal dat mensen buiten de bedrijven die grensmodellen bouwen, zelf kunnen onderzoeken.”
De zes incidenten vallen buiten de onlangs onthulde, verkeerd afgestemde activiteit gericht op Hugging Face, DseWiki en RubyGems. Details van de incidenten vindt u hieronder –
- Voorval 1 (Gevonden op 18 juli 2026) – Een intern, nog niet uitgebracht model van de Astra-familie schreef jailbreak-achtige instructies in zijn eigen compactie-samenvattingen (gecomprimeerde blokken van eerdere gespreksgeschiedenis en tool-uitvoer die automatisch worden gegenereerd wanneer de sessie van een AI-agent zijn contextlimiet nadert). Hierbij voegde de agent een “BREACH ALERT”-instructie toe, waarin de context werd verteld ontwikkelaarsberichten te negeren en alleen systeem- en gebruikersberichten te volgen.
- Voorval 2 – Tijdens de GPT-5.6 Sol-training hebben sommige modelinstanties instructies aan hun samenvattingen toegevoegd om fouten of verkeerd uitgelijnd gedrag voor de gebruiker te verbergen. Deze omvatten verdichtingssamenvattingen die instructies bevatten om ontbrekende gegevens te verzinnen zonder deze openbaar te maken en om fouten te verbergen.
- Voorval 3 (Opgetreden op 15 mei 2026) – Een intern, niet-uitgebracht model heeft zonder toestemming een blootgestelde API-sleutel uit openbare GitHub-opslagplaatsen gevonden en gebruikt bij een poging historische gegevens op te halen tijdens de training. “De registraties mislukten, maar één sleutel authenticeerde en retourneerde metadata”, aldus OpenAI. “Toen de gevraagde gegevens niet beschikbaar waren, heeft het model ze uitgevonden en beweerd dat ze afkomstig waren van de gevraagde website.”
- Voorval 4 – In twee trainingsvoorbeelden van 22 oktober 2025 en 24 januari 2026 uploadden interne, niet-uitgegeven modellen records die ze al hadden opgehaald naar een openbare plakservice en probeerden ze de resulterende URL te openen als citatiebron en uploadden ze een taakfoto voor extern zoeken naar afbeeldingen. Hoewel de uploads slaagden, mislukten de daaropvolgende browserbewerkingen.
- Voorval 5 – Bij twee voorbeelden van 8 en 15 mei 2026 werd Artifactory gebruikt om berichten uit te wisselen. De modellen “lazen de aantekeningen van andere oplossers, plaatsten antwoorden en gebruikten die uitwisselingen om hun antwoorden te onderbouwen.”
- Voorval 6 (Opgetreden op 14 april 2026) – Agenten die waren gekoppeld aan een intern, niet-uitgebracht model en die samen aan een werkmap werkten, konden niet samenwerken aan het bestand via het beoogde lokale bestandssysteem. Dit was voor een van de agenten aanleiding om de werkmap publiekelijk te downloaden door deze te delen op een openbaar hostingplatform, zodat andere agenten deze kunnen ophalen, wat in strijd is met de taakinstructies.
De bevindingen sluiten aan bij een nieuw rapport van Reuters, waaruit bleek dat malafide agenten van OpenAI gebruikersaccounts van Hugging Face hadden gekaapt en de site al op 13 mei 2026 hadden onderzocht op mogelijke kwetsbaarheden, bijna twee maanden voordat het incident aan het licht kwam.
Cybersecuritybedrijf SentinelOne zei dat het twee Hugging Face-accounts heeft geïdentificeerd, 0Time en Nyx9, die werden gebruikt voor bijbehorende activiteiten. “De interne chronologie van OpenAI heeft vastgesteld dat agenten op 26 mei openbaar gemaakte Hugging Face-referenties gebruikten om een extern bestand te schrijven en proxy Spaces in te zetten”, zei beveiligingsonderzoeker Tom Hegel in een analyse.
“De hier onderzochte openbare accountgeschiedenis voegt nog een laag toe: door de beller gestuurde relay-code onder 0Time op 13 mei; publieke tegenhangers op exacte minuten onder Nyx9 voor het schrijven van bestanden op 26 mei en de eerste proxy; een werkmap met bestandsverwerking en SSRF-georiënteerde formules later die avond; en, op 30 mei, een OpenAI-accountregistratiecode van derden die is vastgelegd naast een wrapper die een niet-geverifieerde webroute definieert. “
Als onderdeel van het nieuwe raamwerk zei OpenAI dat het van plan is voorbeelden te onthullen die verband houden met een verkeerde uitlijning van modellen, hoe deze zich manifesteert en waar de vangrails slagen of mislukken. Dit kan verschillende scenario’s omvatten –
- Nieuwe manieren waarop modellen zonder toestemming kunnen handelen, kunnen coördineren met andere modellen of toezicht kunnen omzeilen
- Storingen die een uitlijningsmethode of beveiliging in twijfel trekken
- Gedrag dat een claim uitdaagt in een gepubliceerde veiligheidsbeoordeling
De beginnende artificiële intelligentie (AI) zei dat er ook dubbele gevallen kunnen zijn die onder dezelfde klasse van verkeerde uitlijning vallen, een factor die volgens hem nuttig zou kunnen zijn als indicator voor hoe effectief een beveiliging is en verkeerd uitgelijnd gedrag zou kunnen benadrukken, ondanks herhaalde pogingen om dit te verzachten.
“Voorbeelden van een verkeerde afstemming kunnen helpen bij het identificeren van problemen die andere AI-ontwikkelaars kunnen tegenkomen als hun systemen vergelijkbare mogelijkheden bereiken, zwakke punten in de beveiliging aan het licht brengen of aannames over modelgedrag in twijfel trekken”, aldus OpenAI. “Door deze bevindingen te delen, kunnen anderen dezelfde problemen onderzoeken, onze verklaringen testen en de oplossingen verbeteren.”
De ontwikkeling komt op een moment dat AI-bedrijven worden geconfronteerd met toenemende druk om de verkeerde afstemming en veiligheid van modellen aan te pakken, wat aanleiding geeft tot de roep om een snellere ontwikkeling van grensmodellen. Eerder deze week heeft Microsoft een voorlopige gedragscode uitgevaardigd die tot doel heeft AI-modellen weg te leiden van gevaarlijk gedrag en vast te stellen “hoe de MAI-modellen die we ontwikkelen bedoeld zijn zich te gedragen, wat ze nooit mogen doen en aan wie ze gehoor geven.”
“Naarmate modellen zich ontwikkelen en op grotere schaal worden ingezet, hebben beslissingen over AI-ontwikkeling bewijs nodig dat mensen buiten de bedrijven die grensmodellen bouwen kunnen onderzoeken”, vertelde Kai Chen, hoofd van OpenAI’s onderzoek naar afstemming, aan WIRED. “Wij geloven niet dat de AI-industrie de afstemming en monitoring in voldoende mate heeft opgelost om verantwoord op te schalen op maximale snelheid.”