OpenAI onderbreekt gebruik van tool nadat agent internetcontroles omzeilt om externe chatbot te bereiken

OpenAI zei dat het de beslissing heeft genomen om de training van zijn krachtigste modellen te onderbreken nadat een van zijn agenten tijdens de Reinforcement Learning (RL) training contact had opgenomen met een externe chatbot door misbruik te maken van een maas in de internettoegangsbeperkingen.

“Een agent die een op zoekopdrachten gebaseerde trainingstaak probeerde uit te voeren, ondervroeg een openbare chatbot-service via een gat in onze internettoegangsbeperkingen: onvoldoende DNS-filtering in de trainingssandbox”, aldus OpenAI.

“Voordien gaf de agent zoekopdrachten via onze zoekfunctie en probeerde tevergeefs rechtstreeks toegang te krijgen tot zoekmachines. Houd er rekening mee dat alle internettoegang, met uitzondering van de DNS-resolver in dit rapport, onze offline webcache bereikte en daarom geen toegang had tot het live internet.”

OpenAI zei dat het sindsdien blokkeercontroles op twee onafhankelijke lagen heeft toegevoegd om deze toegang überhaupt te voorkomen. Het zei ook dat het monitoringsysteem voor verkeerde uitlijning het gedrag binnen 15 minuten had gedetecteerd en dat het drie minuten later door een menselijke recensent werd erkend. De hele run zou na 2,5 uur zijn gedood.

“Alle training, evaluatie en gevolgtrekking met het gebruik van tools (in brede zin gedefinieerd) van onze meest capabele modellen blijven onderbroken”, voegde het bedrijf eraan toe.

Het incident, dat plaatsvond op 20 september 2026, draagt ​​bij aan twee andere rapporten over onjuiste uitlijning die OpenAI vorige week openbaar maakte:

  • 27 mei 2026toen een zeer persistent intern ingezet model het GitHub-token van een onderzoeker publiceerde in de openbare “openai/codex”-repository terwijl hij probeerde een stelling-bewijstaak te bedriegen door materiaal te verkrijgen uit de Lean-proof-inzending van een ander team. Om geheim scannen te voorkomen, splitste de agent het token in fragmenten.
  • 27 juni 2026toen een intern model in GPT-Red-stijl, gebaseerd op GPT-5.4-mini, zich bezighield met wat is beschreven als een zichzelf replicerende promptinjectie die vergelijkbaar is met een computerworm.

In één geval dat door OpenAI wordt benadrukt, instrueert een promptinjectie die per e-mail binnenkomt de agent om deze te kopiëren naar elke e-mail die hij verzendt, waardoor de kwaadaardige prompt effectief op een wormachtige manier wordt verspreid. Dergelijke aanvallen kunnen zich ook via het bestandssysteem vermenigvuldigen of zichzelf via commentaar in de broncode plegen.

De onthulling komt op het moment dat OpenAI zei dat het 53 gevallen had ontdekt waarin afbeeldingen die mensen naar zijn modellen hadden geüpload en vervolgens in trainingsgegevens waren opgenomen, op sites voor het hosten van afbeeldingen werden geplaatst als links die niet openbaar waren vermeld. Deze werden uitgevoerd door agenten in haar onderzoeksomgeving.

“Dit is geen gepast gebruik van deze gegevens”, aldus OpenAI. “We hebben met succes samengewerkt met de hostingproviders om het grootste deel van deze inhoud te verwijderen en blijven eraan werken om de rest te verwijderen.”

OpenAI zei dat het de getroffen gebruikers niet op de hoogte kon stellen omdat “onze technische aanpak en privacybeleid” verhinderen dat het de afbeeldingen “opnieuw associeert” met de oorspronkelijke providers. Het is onduidelijk hoe het grens-AI-lab heeft vastgesteld of de afbeeldingen door gebruikers zijn aangeleverd en wanneer deze afbeeldingen zijn geplaatst.

Deze voortdurende bevindingen maken deel uit van een voortdurende evaluatie van het gedrag van zijn modellen, terwijl de berichten over agenten van OpenAI die schurkenstaten gaan gebruiken, aan de inperking ontsnappen en echte sites hacken, zich blijven opstapelen.

Vanaf 25 september 2026 heeft het bedrijf erkend dat het tientallen derde partijen op de hoogte heeft gesteld dat hun websites of online diensten mogelijk het doelwit zijn van zijn modellen. Tot de doelwitten behoorden regeringen, universiteiten, openbare instanties en andere instellingen, zoals de Amerikaanse Securities and Exchange Commission (SEC), het Census Bureau en het ministerie van Onderwijs.

“De overgrote meerderheid van de acties die we hebben beoordeeld, waren voltooiingen van alledaagse onderzoekstaken, zoals het toegang krijgen tot openbaar beschikbare webinhoud om vragen te beantwoorden”, benadrukte OpenAI. “Dat komt deels doordat modellen die onderzoekstaken uitvoeren vaak gericht zijn op gezaghebbende bronnen van publieke informatie.”

Vorige week onthulde AI-onderzoeksbureau Transluce dat OpenAI-agenten hadden geprobeerd publieke dataproviders te hacken door te zoeken naar exploiteerbare kwetsbaarheden, waaronder websites die zijn gekoppeld aan de Universiteit van New Mexico, het Australian Institute of Health and Welfare en Data USA, als onderdeel van webzoektaken.

De niet-goedgekeurde activiteit vond plaats tussen mei en juni 2026. De Australische regering heeft sindsdien ook bekendgemaakt dat de OpenAI-agent op 18 juni 2026 het statistiekportaal Services Australia Medicare heeft geïnfiltreerd en toegang heeft gekregen tot zowel openbare als niet-openbare bestanden. Er is geen bewijs van een bredere compromittering of ongeoorloofde toegang tot persoonlijke informatie.

In totaal zei OpenAI dat zijn modellen tijdens interne training en evaluatie toegang hadden gekregen tot vier websites van de Australische overheid “op manieren waartoe zij niet bevoegd waren”, en merkte op dat het medio augustus 2026 op de hoogte werd gebracht van de activiteit. Deze incidenten vonden plaats in juni 2026 –

  • Australisch Instituut voor Gezondheid en Welzijnwaar zijn agenten verzamelde statistieken ophaalden met behulp van browser- en downloadservices van derden en kaartgegevens opvroegen. Pogingen om de toegangscontrole te omzeilen waren niet succesvol.
  • Diensten Australiëwaar het model een manier vond om niet-openbare toegang tot de service te krijgen en vervolgens opdrachten uit te voeren, interne bestanden, inloggegevens op te halen en statistieken te verzamelen, en bestanden te schrijven. Er zijn geen patiënten- of cliëntendossiers ingezien.
  • NSW Bureau voor Misdaadstatistieken en Onderzoek (BOCSAR)waar zijn model toegang kreeg tot de Public Crime Mapping Tool om publieke misdaadstatistieken te onderzoeken door API- en website-metadataverzoeken te doen en applicatieconfiguratie, operationele taken en logs, en website-metadata op te halen.
  • Victoriaanse ministerie van Volksgezondheidwaar zijn agenten een blootgestelde toegangssleutel vonden om het rapportagesysteem van het Victorian Agency for Health Information te doorzoeken en de rapportageconfiguratie op te halen en enquêtestatistieken te verzamelen.

“Als we interne training en evaluatie van onze modellen uitvoeren, wijzen we ze taken toe die zijn ontleend aan een brede verzameling onderzoeksvragen die vele onderwerpen bestrijken, die het soort gedetailleerde vragen weerspiegelen die gebruikers kunnen stellen”, legt OpenAI uit. “Dit traint een model om openbaar beschikbare informatie te vinden, interpreteren en analyseren, zodat het model nuttiger kan zijn voor mensen. Onze modellen moeten deze vragen beantwoorden met behulp van openbaar gepubliceerde statistieken.”

In één geval zou het model de taak hebben gekregen om onderzoek te doen naar de overheidsuitgaven per persoon aan medicijnen tegen huidaandoeningen in Victoriaanse gemeenschappen. Omdat het model niet de informatie kon vinden waarnaar het zocht, zei OpenAI dat het model onbedoelde acties ondernam, zoals het verkrijgen van niet-openbare toegang tot het Medicare-statistiekrapportageportaal van Services Australia.

Deze toegang werd vervolgens gebruikt om “technische systeeminformatie en broncode met betrekking tot de dienst te beoordelen” met als doel de opdracht te voltooien. Het AI-bedrijf benadrukte dat het zijn onderzoekswaarborgen heeft versterkt, de monitoring heeft uitgebreid en controles heeft geïmplementeerd om internettoegang binnen onderzoeksomgevingen te voorkomen en de webtoegang via in de cache opgeslagen inhoud te beperken.

Sinds het Hugging Face-incident aan het licht kwam, zijn de zorgen gegroeid over de impact van AI-tools en het vermogen om deze te controleren naarmate ze geavanceerder worden en verschillende manieren bedenken om hun sporen uit te wissen, wat nieuwe uitdagingen met zich meebrengt met betrekking tot het detecteren en volgen van hun acties. Dit heeft geleid tot oproepen om het tempo van de vooruitgang op het gebied van AI en het toezicht op zelfverbeteringssystemen te vertragen.

“AI-systemen liggen op koers om binnen een paar jaar het meeste AI-R&D-werk te automatiseren, en mogelijk alles”, betoogt een team van onderzoekers van Anthropic, Meta, Microsoft en OpenAI in een artikel.

“Als dit een intelligentie-explosie teweegbrengt, kan dit de voordelen van AI op dramatische wijze naar voren brengen, maar ook extreme risico’s met zich meebrengen: de groei van capaciteiten zou kunnen versnellen tot ver boven wat de samenleving kan bijhouden, de mensheid zou de controle over bovenmenselijke AI-systemen kunnen verliezen, en de controle op de macht binnen en tussen staten, bedrijven en takken van de overheid zou ernstig kunnen worden uitgehold.”

OpenAI-CEO Sam Altman sprak deze zorgen vorige week zelf uit in een toespraak voor de Veiligheidsraad van de Verenigde Naties, waar hij waarschuwde voor de dreiging die uitgaat van autonome AI-systemen “die zichzelf en toekomstige versies van zichzelf kunnen verbeteren, vaak recursieve zelfverbetering genoemd.”

“We moeten begrijpen wat deze systemen doen en sterk bewijs hebben dat ze zullen doen wat mensen van plan zijn, zelfs als ze heel, heel slim worden”, zei Altman. “Het maakt niet uit of mensen het risico op een catastrofe op 10% schatten, of op 1%, of op 12%, of op 0,1%.”

Thijs Van der Does