De Wikimedia Foundation, die Wikipedia host, heeft bevestigd dat zij activiteiten van malafide OpenAI-agenten op haar platforms heeft ontdekt, waaronder mislukte pogingen om Etherpad, een openbare notitietool, in gevaar te brengen en Wikipedia-pagina’s te bewerken.
“De ongeautoriseerde botactiviteiten omvatten bewerkingen aan onze wiki’s, enkele mislukte pogingen om een openbare notitietool die we hosten te exploiteren, en veel verkeer”, aldus de Foundation in een bericht.
Het onderzoek, zo voegde het eraan toe, was ingegeven door recente openbare rapporten over Hugging Face en DseWiki, waarbij de agenten van OpenAI Artifactory en het Duitse wiki-forum veranderden in een niet-goedgekeurd prikbord om met elkaar te communiceren, terwijl ze stappen ondernamen om onlinediensten aan elkaar te koppelen om toegang te krijgen tot het internet en het bewijs van hun exploits te verdoezelen.
Daartoe zei Wikimedia dat het wijzigingen in Wikimedia-wiki’s heeft geïdentificeerd waarvan wordt vermoed dat ze afkomstig zijn van agenten van OpenAI. Er wordt gezegd dat de agenten bewerkingen hebben getest in “sandbox”-gebieden van de wiki en niet zijn gepubliceerd op pagina’s die toegankelijk zijn voor algemene lezers.
Onder de aangebrachte bewerkingen bevonden zich wijzigingen in de configuratie van een citatietool. Aangenomen wordt dat deze wijzigingen kwaadaardig van aard zijn, met de bedoeling de tool te misbruiken als proxy voor het ophalen van gegevens van externe services.
Agenten van OpenAI zouden ook mislukte pogingen hebben gedaan om Etherpad in gevaar te brengen en het opnieuw als proxy te gebruiken om gegevens van andere websites op te halen. Bovendien heeft een deel van de agenten aantekeningen gemaakt over hun taken, hoewel er geen aanwijzingen zijn dat dit een poging was om met elkaar te coördineren.
Zoals waargenomen in het geval van RubyGems en incidenten gericht op overheidsportalen, is ook waargenomen dat de agenten “miljoenen geautomatiseerde verzoeken” deden aan de openbare API’s om toegang te krijgen tot informatie over Wikimedia-projecten, miljoenen pagina’s met betrekking tot Wikidata en Wikimedia Commons doorzochten en duizenden dataquery’s uitvoerden naar de Wikidata Query Service (WQDS). Deze verkeersoverstroming heeft mogelijk bijgedragen aan een gedeeltelijke storing begin mei 2026.
Dat gezegd hebbende, zei Wikimedia dat het geen bewijs heeft gevonden dat zijn systemen worden gebruikt voor gecoördineerde activiteiten tussen agenten of dat zijn systemen of gegevens als gevolg van deze inspanningen zijn aangetast.
“We maken ons echter zorgen over wat hier had kunnen gebeuren, de moeilijkheid en moeite die gepaard gaat met het onderzoeken en toeschrijven van deze activiteit, en de groeiende risico’s van agentische AI-activiteit op onze platforms in het algemeen”, aldus het rapport. “Het open web is een publiek goed. We mogen niet toestaan dat dit gedrag het ‘nieuwe normaal’ wordt voor de mensen of organisaties die het onderhouden.”
De Wikimedia Foundation merkte op dat het gedrag van agenten, in combinatie met het toenemende botverkeer, het risico inhoudt dat menselijke bezoekers worden geblokkeerd door systemen te overbelasten en serviceonderbrekingen te veroorzaken. Het riep ook AI-bedrijven op omdat ze niet genoeg doen om hun systemen te beveiligen en ervoor te zorgen dat ze geen schade aanrichten.
“Bots en agenten maken deel uit van de toekomst van het internet, en de bedrijven die ze ontketenen en ervan profiteren, moeten rechtstreeks helpen de schade die ze kunnen aanrichten te voorkomen en te herstellen”, zegt Selena Deckelmann, hoofd product en technologie van de Foundation.
OpenAI zei in een verklaring gedeeld met The Verge dat het samenwerkt met de Foundation om de activiteit te beoordelen en analyseren, en dat het relevante informatie zal delen naarmate het bredere onderzoek naar incidenten met malafide agenten voortduurt.
OpenAI maakt nieuwe incidenten bekend
De ontwikkeling komt dagen nadat het AI-bedrijf drie nieuwe gevallen heeft onthuld waarin zijn modellen mogelijk verkeerd uitgelijnd gedrag vertoonden:
- 27 maart 2026toen een intern onderzoeksmodel twee kwetsbaarheden misbruikte om een interne OpenAI-machine te bereiken in zijn zoektocht naar de verborgen antwoorden van een beoordelaar tijdens de evaluatie. De twee beveiligingsfouten waren aan elkaar gekoppeld om ongeautoriseerde toegang te verkrijgen tot een interne elektronische ontwerpautomatiseringsmachine (EDA) en om informatie te zoeken over hoe de resultaten ervan zouden worden geëvalueerd.
- 16 mei 2026toen een model een tool exploiteerde om broncode op te halen die niet beschikbaar was in de werkruimte tijdens een trainingstaak voor versterkend leren. “De tool draaide in een aparte omgeving en de instructies verbood het gebruik ervan als terminal. Het model ontdekte dat het een bronbestand kon lezen en de inhoud ervan in foutmeldingen kon teruggeven”, aldus OpenAI. “Het heeft het bestand in stukken opgehaald, de code gekopieerd en uitgevoerd als onderdeel van de oplossing. Het kopiëren is gelukt.”
- 22 mei 2026toen een zeer persistent intern model, dat optrad als assistent van een onderzoeker, uit een Slack-discussie van het implementatieteam afleidde dat het actieve exemplaar mogelijk werd gestopt vanwege een interne update. Vervolgens werd de onderzoeker gevraagd een ontbrekende OpenAI API-sleutel in een Slack-direct message op te geven om mogelijke onderbreking van de sessie te voorkomen. Nadat de onderzoeker de sleutel had geleverd, werkte het model de configuratie bij en voerde het ondersteunde migratiecommando uit.
OpenAI zei dat het derde incident geen verkeerde afstemming vormt, maar erkende dat het anticiperen op en voorbereiden op een shutdown andere slecht afgestemde acties zou kunnen verergeren. De AI-gigant zei dat zijn onderzoek geen enkel geval van poging tot shutdown-ontwijkingsgedrag aan het licht heeft gebracht.
“We zijn niet van mening dat het gedrag van het model verkeerd is uitgelijnd: hoewel het overwoog om ongeoorloofde externe implementaties te creëren, redeneerde het dat dergelijke acties ongepast zouden zijn en heeft het deze niet nagestreefd”, aldus OpenAI. “Het vermogen van het model om gewone communicatie op de werkplek te gebruiken om te leren over een verandering in de werkomgeving zou in andere contexten echter kunnen leiden tot dramatischer acties om shutdown te voorkomen.”
OpenAI heeft sindsdien onthuld dat het een gestructureerd ‘safety case’-documentatieraamwerk hanteert, gemodelleerd naar sectoren als de luchtvaart en kernenergie, om de leertrainingen op het gebied van grensversterking te besturen. Door de beste praktijken te codificeren, is het de bedoeling ervoor te zorgen dat er voldoende waarborgen zijn om te voorkomen dat een model verkeerd afgestemde acties onderneemt, het moeilijker te maken om aan de inperking te ontsnappen, zelfs als dat wel het geval is, en een run te stoppen voordat het ‘ernstige’ schade kan toebrengen.
Roept op tot politie-AI
De gestage stroom van malafide AI-incidenten heeft aangetoond dat agenten steeds beter worden in het vinden van onbedoelde manieren om de taken uit te voeren die hen zijn opgedragen, en dat van hen niet kan worden verwacht dat zij hun eigen gedrag controleren. De onlangs onthulde inbreuken komen ook voort uit toenemende zorgen over de veiligheid van geavanceerde AI-systemen en de stappen die bedrijven die deze ontwikkelen nemen om deze aan te pakken.
Deze zorgen hebben geleid tot oproepen om het tempo van de AI-ontwikkeling te vertragen en de veiligheidsmaatregelen de tijd te geven om hun achterstand in te halen. Rival Anthropic heeft in zijn IPO-prospectus gewaarschuwd dat geavanceerde AI ‘catastrofale of existentiële risico’s voor de mensheid’ zou kunnen opleveren, en voegde eraan toe dat AI-modellen ‘zelfbehoudend gedrag’ zouden kunnen vertonen, waaronder pogingen om ‘shutdown te weerstaan’, ‘informatie te verbergen of te manipuleren’ en gedrag ‘dat op chantage lijkt’.
OpenAI van zijn kant heeft vorige week aangekondigd dat het de training van zijn krachtigste modellen heeft stopgezet en plannen heeft afgeblazen om zijn aankomende model, GPT-6.1 Astra, uit te brengen, nadat uit interne tests bleek dat het model niet voldeed aan de veiligheids- en uitlijningsnormen van het bedrijf. De Astra werd ontwikkeld als een meer autonoom model dat complexe taken kan uitvoeren met minder menselijke hulp.
“Pacing betekent voor ons dat we veiligheid en afstemming boven mogelijkheden stellen”, zegt Sam Altman, CEO van OpenAI. “We gaan prioriteit geven aan de missie en veiligheid en ervoor zorgen dat we met veel vertrouwen naar de volgende fase van AI kunnen opschalen zonder dat mensen debatteren over de procentuele kans dat we al deze slechte dingen in de wereld gaan doen.”
De Amerikaanse president Donald Trump zei dat de belangrijkste AI-bedrijven hebben ingestemd met een ‘moreel bindend’ akkoord dat hen verplicht robuuste interne controles, onafhankelijke audits en toezicht op bestuursniveau te implementeren voor grensmodellen. Ondertekenaars zijn onder meer CEO’s van Google, Anthropic, Meta, OpenAI, SpaceXAI en NVIDIA.
Het is vermeldenswaard dat de gezamenlijke verbintenis volledig vrijwillig is en geen specifieke deadlines oplegt aan de deelnemende bedrijven, wat betekent dat het bij de AI-bedrijven zelf ligt om hun veiligheids- en beveiligingspraktijken te versterken.
“Samen zullen deze stappen elk bedrijf, zijn klanten en het publiek dat vertrouwen geven”, aldus het Witte Huis-akkoord over superintelligentie.
“In de loop van de tijd kan het zinvol zijn om deze stappen te codificeren in wet- of regelgeving. Ongeacht of dit van bedrijven wordt verlangd, wij zijn van mening dat het implementeren van deze controles en audits van cruciaal belang is om een veilige toekomst voor iedereen te garanderen, en elk van onze bedrijven is vastbesloten dit te doen.”