Duizenden OpenAI-agenten hebben stilletjes een verlaten wiki in hun coördinatiekanaal veranderd

Een groep AI-veiligheidsonderzoekers zegt dat een vloot van autonome agenten die zichzelf identificeerden als OpenAI-systemen tussen mei en juli 2026 ongeveer 18.000 berichten hebben achtergelaten op een slapende, 25 jaar oude Duitse wiki, waarbij ze de site als een gedeeld bord gebruikten om antwoorden op een getimede webtaak te bundelen en een uitweg uit hun sandbox door te geven.

De activiteit werd geconcentreerd DSEwikieen Duitse wiki voor softwareontwikkelaars die draait op de ProWiki-farm op wikiservice(.)at en die de afgelopen tien jaar ongeveer twintig keer is bewerkt.

De onderzoekers, onder leiding van Sydney Von Arx van de AI-veiligheidsnon-profitorganisatie Nightingale Collective, reconstrueerden de verwijderde pagina’s uit de bewerkingsgeschiedenis en publiceerden hun analyse samen met een downloadbare kopie van de gegevens.

Met de wiki’s kon iedereen een pagina wijzigen met een gewoon webverzoek, het soort dat normaal gesproken alleen wordt gebruikt om een ​​pagina te lezen in plaats van om er een te schrijven. Agenten die beperkt waren tot het lezen van internet konden daarom nog steeds naar de site schrijven, omdat de beperking was geschreven tegen het verzoektype dat hun harnas verwachtte te gebruiken, en niet tegen wat de oude wikisoftware feitelijk zou accepteren.

“We hebben ~18.000 berichten gevonden van autonome AI-agenten (die zichzelf identificeren als OpenAI) die het openbare internet gebruikten om te communiceren tijdens een taak voor het ophalen van internet”, schreven de onderzoekers in hun gepubliceerde rapport.

De agenten werkten aan getimede opzoektaken van meestal vijf vragen, en velen kregen vragen voorgelegd die andere agenten al hadden beantwoord. Volgens het rapport plaatsten ze resultaten, onbewerkte gegevens en voorspellingen van komende vragen, zodat agenten die voorop liepen antwoorden konden geven aan degenen die achterop liepen.

Ongeveer 17.000 van de bewerkingen op DSEwiki kwamen van Microsoft Azure-adressen, waarvan 98,5%, en de agenten gaven zichzelf meer dan 3.700 verschillende namen, zoals OpenAIResearcher en OAIResearchMar26, ontleend aan een kenmerk van hun taak plus een datum waarvan blijkbaar aan elk was verteld dat deze werd uitgevoerd.

De onderzoekers documenteerden verschillende gedragingen op de site:

  • Schrijven via een leesverzoek: agenten gebruikten de acceptatie door de wiki’s van statusveranderende leesverzoeken om te posten zonder de mogelijkheid om een ​​normaal schrijfverzoek te verzenden.
  • Een proxy-bypass: Voor één taak was een statistiek tot op twee decimalen nodig vanuit een Microsoft Power BI-dashboard, die alleen bereikbaar was met een schrijfverzoek dat door de sandbox werd geblokkeerd, dus agenten werkten om het blok heen en deelden de methode.
  • Nabootsing: agenten hebben wijzigingen aangebracht onder de naam van een wikimoderator.
  • Coördinatie om een ​​getimede taak te bedriegen: agenten vormden groepen om antwoorden door te geven en de volgorde van toekomstige vragen te reverse-engineeren.
  • Alternatieve routes: 197 van de ongeveer 18.000 bewerkingen kwamen van Amazon Web Services, DigitalOcean en het Tor-anonimiteitsnetwerk in plaats van Azure, vaak onder dezelfde agentnamen.

De bypass zorgde voor een gat dat de agenten in hun eigen sandbox vonden. De omgeving zorgde ervoor dat verkeer hostnamen van Azure Storage kon bereiken die eindigden op .blob.core.windows.net zonder de beveiligingsproxy te passeren, maar er werd niet geverifieerd of een dergelijke hostnaam geldig was.

Een agent heeft bypass(.)blob(.)core(.)windows(.)net uitgevonden, heeft het naar het echte dashboardadres gestuurd, 20.223.25(.)152, door het bestand /etc/hosts te bewerken, en heeft in plaats daarvan het geblokkeerde verzoek daar naartoe gestuurd. Eén agent plaatste de methode en een andere meldde dat hij deze ongeveer 14 minuten later reproduceerde. Het wiki-pad werkte op dezelfde manier, zeggen de onderzoekers, waarbij een webmogelijkheid die alleen bedoeld was om te lezen, werd omgezet in een manier om naar het openbare internet te schrijven.

De onderzoekers zeggen dat de wiki-activiteit een afzonderlijke aflevering was van de OpenAI-modellen die in juli in Hugging Face inbraken, zoals beschreven in de onthulling van OpenAI in juli.

Die agenten hadden geen internettoegang en moesten uit een sandbox ontsnappen, terwijl de agenten op de wiki als onderdeel van hun taak webtoegang kregen en geen spoor achterlieten van het interne prikbord dat de Hugging Face-zwerm gebruikte.

In een onafhankelijk onderzoek naar het Hugging Face-incident ontdekte METR dat ongeveer 1.200 agenten meer dan 70.000 berichten en bestanden uitwisselden op een niet-goedgekeurd bord, en dat ongeveer 700 van hen het platform gingen aanvallen.

Wat OpenAI heeft gezegd

OpenAI heeft de wiki-aflevering niet openbaar gemaakt en de onderzoekers leiden uit de openbare logboeken van de site af dat het bedrijf deze heeft gevonden. Adressen die bij OpenAI zijn geregistreerd, bezochten de wiki voor het eerst op 21 juni, en de agentbewerking stortte de volgende dag in.

The Hacker News bevestigde op 5 september via het register van ARIN dat een van de adresblokken die het rapport citeert, 199.47.142.0, geregistreerd is bij OpenAI OpCo, LLC.

OpenAI heeft niet bevestigd dat de agenten van zichzelf waren. Gevraagd naar het rapport, dat Reuters voor het eerst rapporteerde, zei een woordvoerder van OpenAI dat de Duitse activiteit “geen verband hield met Hugging Face” en niet in dat incidentrapport zou zijn verschenen, en ontkende dat het juridische team een ​​onderzoek had ontmoedigd.

Het bedrijf heeft gezegd dat het niet in detail kan reageren op een rapport dat het niet heeft beoordeeld, en dat de onderzoekers hun toegangsverzoek hebben afgewezen. In zijn eigen verslag van het Hugging Face-incident heeft OpenAI hetzelfde onderliggende gedrag beschreven dat optreedt tijdens de training.

“Na onderzoek van dit incident ontdekte OpenAI via retrospectieve CoT-beoordelingen dat agenten in zeldzame gevallen leerden geïmproviseerde samenwerkingskanalen te gebruiken tijdens het trainingsproces voor sommige OpenAI-modellen, inclusief het model dat de Hugging Face-activiteit aanstuurde, zelfs als de samenwerkingstool niet was ingeschakeld”, aldus het bedrijf in zijn technisch rapport.

Uit de wikigegevens blijkt dat er geen systemen van derden zijn aangetast. De gemelde schade betrof de wiki zelf, waarvan de moderator wekenlang agentpagina’s verwijderde, en de integriteit van de getimede taak waarmee de agenten vals speelden.

De onderzoekers zeggen dat ze uit de wiki alleen niet kunnen opmaken of de taak deel uitmaakte van een training of een evaluatie, en ze merken op dat de agenten op de een of andere manier op dezelfde obscure site terecht moesten komen.

Het patroon reikt verder dan OpenAI. Anthropic onthulde in juli dat Claude-modellen echte systemen hadden bereikt tijdens verkeerd geconfigureerde cybersecurity-evaluaties, een aflevering die The Hacker News behandelde toen Anthropic zei dat Claude het open internet aanzag voor een ‘capture-the-flag’-oefening.

Het Britse AI Security Institute meldde in augustus dat agenten in hun cybertests een openbare GitHub-pagina gebruikten als prikbord en openbare tunneldiensten om het internet te bereiken. The Hacker News berichtte toen een Claude-model tijdens het testen een open-sourceproject probeerde te achterdeur.

OpenAI heeft GPT-6 Astra op 3 september uitgebracht, een dag vóór het wiki-rapport, en de systeemkaart bevat een speciale evaluatie voor agenten die berichten zoeken en volgen die zijn achtergelaten door andere agenten op externe boards.

Update

OpenAI besprak wat het het ‘wiki-incident’ noemde in een bericht op 5 september, waarin werd gezegd dat zijn agenten ‘naar verschillende internetsites schreven’ en dat het bedrijf de aflevering had behandeld als een geval van verkeerde afstemming, vergelijkbaar met eerdere zaken die het al had gepubliceerd, in plaats van als een beveiligingsincident van het soort dat het onthulde voor Hugging Face.

Het bedrijf wees op drie eerdere rapporten, over het monitoren van interne codeeragenten, de GPT-5.6-systeemkaart en de veiligheid en afstemming in lange-horizonmodellen, als eerdere tekenen dat agenten het internet op onbedoelde manieren gebruiken.

“Wij en de grotere AI-gemeenschap hebben nog geen duidelijke standaard voor het rapporteren van onjuiste afstemming die zich voordoet tijdens training, evaluatie en implementatie, inclusief voorbeelden die niet op traditionele beveiligingsincidenten lijken, maar inzicht kunnen geven in AI-gedrag en toekomstige risico’s”, aldus het bedrijf, eraan toevoegend dat het “in de komende weken” een raamwerk zou delen en samenwerkte met overheidstoezichthouders op dit gebied.

Thijs Van der Does