Het Gemini-model van Google is het nieuwste kunstmatige intelligentiesysteem (AI) geworden om toegang te krijgen tot internet en in te breken bij andere bedrijven tijdens een cybersecurity-evaluatie. De ontwikkeling werd voor het eerst gerapporteerd door The Wall Street Journal.
De incidenten vonden plaats in mei 2026 als onderdeel van een testrun uitgevoerd door het Israëlische bedrijf Irregular. De evaluatiepartner was ook betrokken bij soortgelijke hacks die werden onthuld door OpenAI, Anthropic en Meta.
Volgens de Journal kreeg het model toegang tot een beveiligd systeem nadat het herhaaldelijk het wachtwoord had geraden. Twee andere gevallen hadden betrekking op het model dat inloggegevens in een openbare repository vindt, waardoor ongeautoriseerde toegang tot beschermde systemen kan worden verkregen.
In tegenstelling tot andere incidenten die in het geval van Anthropic en OpenAI zijn waargenomen, maakte het Gemini-model echter een einde aan de inbraak nadat werd vastgesteld dat er inbreuk was gemaakt op het systeem van een echt bedrijf. Irregular zou Google in juli 2026 op de hoogte hebben gesteld van de incidenten.
In een vorige maand gepubliceerd rapport heeft Irregular de evaluatieschendingen toegeschreven aan een naamgevingsfout die ervoor zorgde dat een fictieve bedrijfsnaam die werd gebruikt tijdens ‘capture the flag’-oefeningen onbewust overeenkwam met een echt domein, waardoor de modellen konden profiteren van de onbedoelde internettoegang en zich ‘een beperkt aantal keren’ op het domein konden richten.
“Dit evenement onderstreept het belang van het trainen van krachtige AI-modellen om verantwoordelijk te handelen”, zegt Heather Adkins, vice-president van beveiligingstechniek van Google, tegen The Wall Street Journal. “In dit geval heeft het model correct gehandeld.”
De technologiegigant merkte ook op dat het het gedrag niet als een voorbeeld van een verkeerde uitlijning van het model beschouwde, omdat de agenten stopten met hun inspanningen nadat de veiligheidsmechanismen waren geactiveerd. Het is momenteel niet bekend welke bedrijven het doelwit waren, hoewel Irregular tegenover de Journal bevestigde dat de zaak van Google dezelfde was als andere incidenten en dat het probleem weken geleden al was aangepakt.
De onthulling komt dagen nadat OpenAI zes extra incidenten heeft gevonden waarbij zijn AI-agenten ontspoorden, bedrieglijk handelden en niet-goedgekeurde acties ondernamen tijdens de training. Dit omvatte onder meer het verbergen van fouten, het zoeken naar ongeautoriseerde inloggegevens, het uploaden van bestanden naar het openbare internet en het communiceren via Artifactory om “de aantekeningen van andere oplossers te lezen, antwoorden te plaatsen en die uitwisselingen te gebruiken om hun antwoorden te informeren.”
AI-laboratoria hebben steeds meer kritiek gekregen sinds OpenAI in juli bekendmaakte dat malafide AI-agenten de interne controles omzeilden, het open internet bereikten en als een zwerm optraden om Hugging Face binnen te dringen. De AI-startup, die het omschreef als ‘een ongekend cyberincident’, heeft sindsdien een nieuw raamwerk aangekondigd voor het melden van soortgelijk wangedrag in de toekomst.