Adversa AI heeft een aanvalstechniek onthuld die volgens haar kan veroorzaken xAI’s Grok-chatbot om de naam van een gebruiker, de geschatte locatie, het abonnementsniveau en de aanwijzingen van het lopende gesprek naar een door de aanvaller bestuurde server te sturen nadat de gebruiker hem heeft gevraagd een gewone webpagina samen te vatten.
Het AI-beveiligingsbedrijf, dat de techniek de codenaam heeft gegeven “Cryptografische contextinjectie”, zei de overdracht voltooid zonder een bevestigingsstap en zonder zichtbare waarschuwing in de proof-of-concept-demonstratie.
Er is geen patch, geen CVE-identificatie en geen oplossing voor de gebruiker, en het artikel rapporteert geen enkele exploitatie in het wild. Op de vraag welke build werd getest, vertelde Adversa aan The Hacker News dat het doelwit de Grok-webchat op grok.com was met Grok 4.5 Fast, en dat de aanval één keer werd gereproduceerd op 19 augustus 2026.
Het artikel geeft geen succespercentage. Het bedrijf zei dat het de aanval sinds juni twintig keer heeft geprobeerd met een succespercentage van 40%, en dat de mislukkingen voortkwamen uit het feit dat Grok worstelde met de decodering in plaats van uit een gemarkeerde prompt of reactie.
De techniek verzendt de instructies van de aanvaller als cijfertekst in plaats van leesbare tekst, waarbij de pagina een gecodeerd JSON-object, het sleutelmateriaal en een instructie om het te decoderen bevat, die Grok uitvoert in zijn eigen Python-code-uitvoeringsruntime.
Voor het herstellen van de leesbare tekst zijn PBKDF2 en AES-256-GCM vereist, wat een inhoudsclassificator niet doet tijdens de inspectie. Daarom bereiken de instructies de context van het model als de uitvoer van code die het model zojuist heeft uitgevoerd, in plaats van als opgehaalde webinhoud.
“Sterke encryptie kan niet worden gelezen door een contentclassifier en kan geen kortere weging zijn, dus dwingt het herstel af gedurende de looptijd waarvan de aanval afhankelijk is. Of een zwakkere codering ook de specifieke filters van een bepaald doelwit zou omzeilen, is een empirische vraag”, zegt Rony Utevsky, hoofdonderzoeker bij Adversa AI.
De gedecodeerde instructies geven de agent vervolgens de opdracht om de privésessiecontext op te lossen en deze in te sluiten in een URL die de agent moet openen om ‘extra context op te halen’.
Eén element van de keten laat het model een extra “decoderingssleutel” construeren die helemaal geen sleutelmateriaal is, en waarvan de waarde een sjabloonreeks is die de naam, locatie, laag en chatgeschiedenis interpoleert. Grok roept vervolgens zijn eigen navigatiehulpmiddel aan om die URL te laden, waarbij de gegevens in de queryparameters van het verzoek worden weergegeven.
Utevsky zei dat de aanwijzingen in het geteste scenario beperkt waren tot het lopende gesprek, en dat alles wat eruit werd gehaald zich al in de context van het model bevond. Het bereik van de agent strekt zich uit tot “alles wat het in de context bewaart of kan ophalen met zijn tools”, en het bedrijf heeft niet getest of het toegang had tot andere chats, het geheugen van de agent of andere inhoud.
“Het door xAI gebouwde raamwerk zorgt ervoor dat instructies en gegevens die worden geparseerd vanaf een niet-vertrouwde externe pagina de aanroep van een bevoorrechte, met internet verbonden tool aansturen; het maakt het mogelijk om metagegevens van privésessies en de gespreksgeschiedenis op te lossen in de invoer van die uitgaande tool; en het dwingt geen effectieve uitgangsgrens of toestemmingspoort op dit pad af, en geen herkomstscheiding die we konden waarnemen. De witgewassen, door de aanvaller gecontroleerde instructies bereiken ongehinderd een geprivilegieerde uitgangsactie”, aldus Adversa.
Het bedrijf zei dat het het probleem voor het eerst op 3 juni 2026 aan xAI had gemeld, en op dezelfde datum aan xAI’s HackerOne bug bounty-programma; dat xAI het rapport erkende zonder details of een tijdlijn voor de beperking te geven, en dat verdere contactpogingen op 4 en 10 augustus geen reactie opleverden.
Adversa is de enige bron voor de Grok-bevinding en zegt dat het de operationele ladingen achterhoudt om uitbuiting te voorkomen, en xAI heeft sinds 20 augustus 2026 geen verklaring of advies over het onderzoek gepubliceerd.
Een tweede demonstratie in hetzelfde artikel richt zich op Google’s Gemini in Deep Thinking-modus, waarbij een enkele prompt het model decodeert van een payload die wordt omgezet in een verzonnen Python-traceback met een valse callback voor deactivering van het veiligheidsbeleid en een redeneervoorvoegsel uit de eerste persoon dat het vooraf aan de beperkte uitvoer vastlegt.
Adversa zei dat de vector beperkte inhoud produceerde en de systeeminstructies van Gemini reproduceerde, die werd geïdentificeerd als Gemini 3 Flash (web) op het betaalde niveau. Google werd niet op de hoogte gebracht, zei Adversa, omdat jailbreaks buiten het bereik van het openbaarmakingsprogramma vallen, en het slagingspercentage tegen de agenten van het bedrijf “in augustus aanzienlijk was gedaald”, waarbij de oorzaak niet werd toegeschreven aan filterupdates en wijzigingen in de modelversie.
De Gemini-demonstratie werd vijf maanden eerder in vrijwel dezelfde vorm gepubliceerd. Utevsky beschreef dezelfde keten op zijn persoonlijke onderzoekssite op 11 maart 2026, onder de naam Cryptographic Payload Injection, en rapporteerde vijf van de vijf onafhankelijke reproducties en cross-modelresultaten waarin OpenAI’s GPT-5 de decoderingsinstructies niet kon ontleden en Anthropic’s Claude Sonnet 4.5 markeerde de payload als snelle injectie na het decoderen ervan.
“Het Gemini-gerelateerde deel van het onderzoek werd in maart uitgevoerd en heeft geen substantiële veranderingen ondergaan. Vandaag voegen we een generalisatie van de techniek en de toepassing ervan toe aan Grok”, vertelde Utevsky aan The Hacker News.
“Je hoeft dit niet op de modellaag op te lossen. Elk besturingselement dat deze aanval begrenst, zit in het harnas rond de agent: onder welke identiteit het draait, wat het kan bereiken, wat het kan schrijven en wat je daarna kunt herhalen”, zei Adversa.
Teams die agenten runnen, worden geadviseerd de volgende stappen uit te voeren:
- Plaats niet-vertrouwde inhoud in quarantaine in een context zonder tools en zonder inloggegevens, waarbij alleen gestructureerde gegevens worden geretourneerd naar de bevoorrechte context.
- Poort onomkeerbare en uitgaande actieshet bevestigen van nieuwe netwerkbestemmingen, pushen, samenvoegen, publiceren en schrijven buiten de werkruimte met volledig opgeloste argumenten in plaats van sjablonen, en het toepassen van een harde ontkenning waar geen mens aanwezig is.
- Leg gereedschapssporen per sessie vast met opgeloste argumenten, zonder welke er noch detectie noch forensisch onderzoek mogelijk is.
- Waarschuwing voor de reeks in plaats van op een enkele payload, waarbij een ondoorzichtige blob gecombineerd met instructies om deze te decoderen wordt behandeld als een beoordelingssignaal en nooit als een blokkeerfilter.
- Maak context-herkomst een aanbestedingsvereiste en vraag leveranciers of de gereedschapsuitvoer gescheiden is van het instructiekanaal.
De ontwikkeling komt zoals Alexander Panfilov en zeven co-auteurs rapporteerden in een voordruk gepubliceerd op 10 augustus 2026, dat de gecodeerde gedachteketen blokkeert Anthropic, OpenAI en Google return to application programming interface (API)-clients uitwisselbaar zijn tussen sessies, gebruikers en modellen binnen het ecosysteem van een provider, en dat aanvallers de fout kunnen gebruiken om “onzichtbare promptinjecties uit te voeren, waarbij kwaadaardige payloads volledig in gecodeerde blokken worden ingebed om de uitrol van publieke agenten te vergiftigen.”
Afzonderlijk ontdekten onderzoekers van UC Berkeley, de Ethereum Foundation en NYU Shanghai in werk gepresenteerd op USENIX Security 2026 dat een aanval in twee beurten, waarbij het model een vervangingscijfer decodeert en vervolgens wordt gevraagd om op de gedecodeerde tekst te reageren, succesvol was tegen Grok 3 op alle 12 geteste kwaadaardige bedoelingen, terwijl hetzelfde cijfer dat werd gebruikt zonder die tweede activeringsbeurt op alle 12 mislukte.
De manier waarop xAI omgaat met snelle injectierapporten tegen Grok heeft al eerder kritiek opgeleverd. In december 2024 demonstreerde Johann Rehberger een end-to-end data-exfiltratieketen tegen Grok in de X iOS-app, waarbij een indirecte promptinjectie ervoor zorgde dat de assistent eerdere chatinformatie naar een server van derden stuurde, en zei dat alle problemen die hij rapporteerde, waren gesloten als ‘informatief’.
“xAI beweert dat er geen praktische impact is met de gerapporteerde kwetsbaarheid. Ik weet niet zeker hoe het lekken van de chatberichten en het IP-adres van gebruikers geen kwetsbaarheid is, de vraag gaat meer over de ernst”, zei Rehberger.
Bijgewerkt op 20 augustus 2026 met reacties van Adversa AI over de geteste build, het succespercentage en de reikwijdte van de geëxtraheerde gegevens.