Anthropic zegt dat zeven in China gevestigde AI-laboratoria Claude-distillatieaanvallen op industriële schaal hebben uitgevoerd

Anthropic zei donderdag dat het illegale distillatie-aanvallen op industriële schaal tegen Claude heeft geïdentificeerd en verstoord vanuit zeven laboratoria in China, waaronder Alibaba, Moonshot, DeepSeek, Z.ai (ook bekend als Zhipu) en MiniMax.

Kennisdistillatie is op zichzelf een legitieme trainingsmethode. Het verwijst naar een machine learning-techniek waarbij een groot, krachtig AI-model de rol van een ‘leraar’ op zich neemt om een ​​kleiner, minder capabel of sneller ‘student’-model te trainen om zijn capaciteiten te kopiëren.

Illegale distillatie daarentegen is een campagne op industriële schaal die heimelijk de mogelijkheden van een model extraheert en deze zonder toestemming repliceert in een ander model, meestal door gebruik te maken van netwerken van nepaccounts die zijn aangemaakt met gestolen creditcards, inloggegevens en API-sleutels.

Frontier AI-laboratoria in het Westen, waaronder die van Google en OpenAI, hebben herhaaldelijk destillatieaanvallen op hun modellen uitgevoerd. Anthropic zei dat het ongeoorloofde laboratoria heeft waargenomen die ‘steeds geavanceerdere methoden’ gebruiken om verdedigingen te omzeilen en de mogelijkheden ervan te benutten, zoals agentische capaciteiten en gereedschapsgebruik, codering en data-analyse, en logisch redeneren, door middel van snelle manipulatietrucs.

“DeepSeek, Xiaomi en Moonshot voerden gesprekken tussen hun eigen modellen en gebruikers in Claude”, aldus Anthropic. “Deze laboratoria gebruikten de antwoorden van Claude vervolgens als trainingsgegevens waarmee de capaciteiten van Claude konden worden gedestilleerd. Sommige van deze uitwisselingen omvatten gevoelige informatie, onder meer van individuele gebruikers, grote multinationale bedrijven en aan de staat gelieerde actoren.”

Het AI-bedrijf zei dat deze laboratoria over het algemeen toegang krijgen tot zijn modellen door verzoeken te routeren via proxydiensten, ook wel overdrachts- of relaisstations genoemd, die duizenden nieuwe accounts aanmaken onder fictieve identiteiten, valse of gestolen creditcards en illegaal verzamelde API-sleutels die toebehoren aan legitieme bedrijven of individuen.

Volgens Anthropic verwerven ongeautoriseerde AI-laboratoria ook transcripties van gebruikersuitwisselingen met Amerikaanse grensmodellen door deze te kopen bij externe wederverkopers, de exploitanten van proxydiensten die dergelijke gesprekken opslaan zonder medeweten of toestemming van de gebruikers.

“In andere gevallen stuurden ongeautoriseerde laboratoria verzoeken van hun gebruikers door naar Claude – zonder medeweten of toestemming van die gebruikers – om uitwisselingen tussen gebruikers en Claude te verzamelen voor training,” merkte Anthropic op.

Sinds februari 2026 zei het AI-bedrijf dat het zes illegale distillatiecampagnes heeft ontdekt die werden uitgevoerd door in China gevestigde AI-laboratoria om hun eigen modellen te bevorderen:

  • GTG-16005 (151 miljoen uitwisselingen waargenomen tussen mei en juli 2026), waarbij een cluster van aan Alibaba gelieerde operators zich richtte op de transcripties van de gedachteketen (CoT) van Claude Opus 4.6 en 4.7 in wat wordt beschreven als de ‘grootste destillatieaanval die we ooit hebben gemeten’. Het bereikte een piek van grofweg 3 miljoen uitwisselingen per dag vanuit meer dan 3.500 frauduleuze accounts die zich richtten op agentische taken, software-engineering, kernelontwikkeling en taken met een lange horizon.
  • GTG-16002 (23 miljoen uitwisselingen waargenomen tussen mei en juli 2026), waarbij Moonshot AI heimelijk klantverzoeken omleidde naar Claude in plaats van ze te verwerken met Kimi, en vervolgens de reacties van Claude aan gebruikers weergaf. Tegelijkertijd werd een subset van deze uitwisselingen vastgelegd en opgeslagen om het CoT-model te trainen. Over een periode van tien dagen zou Moonshot bijna 300.000 klantverzoeken hebben doorgestuurd naar Anthropic via een proxyservicenetwerk van 5.380 frauduleuze accounts, waarvan de meeste zich in Singapore en Japan bevinden.
  • GTG-16001 (Meer dan 12,1 miljoen uitwisselingen waargenomen gedurende 14 dagen in juli 2026), waarbij DeepSeek dezelfde aanpak volgde als Moonshot AI om uitwisselingen stilletjes door te geven aan Claude zonder zijn klanten te informeren en CoT-transcripties te extraheren.
  • GTG-16006 (Meer dan 3,4 miljoen uitwisselingen waargenomen gedurende 17 dagen in juni en juli 2026), waarin Zhipu (ook bekend als Z.ai) een CoT-extractiepijplijn beheerde en de redeneringssporen van Claude via Claude afspeelde om zijn modellen te trainen. De activiteit vond plaats door 273 frauduleuze accounts te rouleren.
  • GTG-16008 (Meer dan 400.000 uitwisselingen waargenomen gedurende 20 dagen in maart en april 2026), waarin Xiaomi gebruikersgesprekken en codeersessies van zijn eigen MiMo-modellen naar Claude herhaalde, via OpenClaw- en OpenCode-coderingsharnassen, om trainingsgegevens te versterken die voor toekomstige modellen worden gebruikt.
  • GTG-16012waarin SenseTime transcripties van gebruikersuitwisselingen met Claude kocht van externe gegevensleveranciers.
  • GTG-16003waarin MiniMax zijn eigen proxy-netwerkdienst bouwde via een shell-bedrijf dat toegang biedt tot modellen ontwikkeld door Anthropic en OpenAI, waarschijnlijk met als doel uitwisselingen tussen gebruikers en Amerikaanse grensmodellen te verzamelen om zijn modellen te trainen.

“De proliferatie van proxydiensten om Anthropic-toegangsbeperkingen te omzeilen heeft een secundaire markt gecreëerd waarop laboratoria geoogste uitwisselingen tussen gebruikers en Claude kunnen kopen of anderszins verwerven”, aldus Anthropic. “Sommige proxynetwerken bieden Claude toegang tot gebruikers in niet-ondersteunde regio’s, en bewaren ook uitwisselingen om deze aan andere laboratoria te verkopen.”

Om illegale distillatie tegen te gaan, zegt het bedrijf dat het reselleraccounts of accounts uit niet-ondersteunde regio’s zoals China, Iran en Rusland verbiedt wanneer gebruikers hun identiteit niet verifiëren. Om het voor niet-geautoriseerde laboratoria moeilijker te maken om de capaciteiten van Claude te destilleren, is het model bijgewerkt om de interne redenering samen te vatten voordat er wordt gereageerd, waardoor gestolen transcripties minder bruikbaar zijn voor vervolgtraining.

“En met Fable 5.1 hebben we behouden denken geïntroduceerd, waardoor nieuwe API-accounts de systeemprompt, tools of berichten die aan Claude’s redenering voorafgaan in multi-turn gesprekken niet kunnen wijzigen”, voegde het bedrijf eraan toe. “Die redenering is gecodeerd, maar het bewerken van de context voordat deze plaatsvindt, is een veelgebruikte techniek die aanvallers gebruiken om Claude deze te laten onthullen.”

De ontwikkeling komt op het moment dat Anthropic zei dat het een aantal accounts heeft verwijderd die probeerden zijn modellen te gebruiken om hun burgers in de gaten te houden en ziekten te onderzoeken op manieren die biologische wapens zouden kunnen ondersteunen. Eerder deze week beschuldigden Amerikaanse cyberveiligheids- en inlichtingendiensten in China gevestigde bedrijven op het gebied van kunstmatige intelligentie (AI) van het uitvoeren van ‘systematische extractie’ van propriëtaire functionaliteiten en mogelijkheden van Amerikaanse grensmodellen door middel van distillatieaanvallen.

Thijs Van der Does