OpenAI verstoort de redeneringsextractiecampagne gekoppeld aan Moonshot AI Associates

OpenAI zei woensdag dat het een gecoördineerde destillatiecampagne heeft geïdentificeerd en verstoord die was ontworpen om op illegale wijze beschermde redeneringen uit zijn kunstmatige intelligentie (AI)-modellen te halen.

Een ‘kerncluster van de activiteit’, die teruggaat tot de eerste week van juli, wordt toegeschreven aan personen die banden hebben met Moonshot AI, een Chinees AI-bedrijf gevestigd in Peking. Er werd geen enkel technisch bewijs aangevoerd om deze beoordeling te staven, waarschijnlijk vanwege veiligheidsredenen.

“De operators hebben onze encryptie niet gebroken, een database gecompromitteerd of directe toegang gekregen tot opgeslagen gebruikersgesprekken”, aldus OpenAI. “In plaats daarvan manipuleerden ze modelinteracties zodat beschermde redeneringen konden worden gereproduceerd in vormen die zichtbaar waren voor de aanvrager op een gecoördineerde, geschaalde manier die in strijd was met onze servicevoorwaarden.”

De activiteit zou zijn begonnen op 1 juli 2026, aanvankelijk op een laag volume, voordat deze op 24 en 25 juli 2026 piekte tot 16.000 pogingen tot verzoeken met behulp van een relevant extractiepatroon van meer dan 4.000 gebruikers. Na verder onderzoek zei het bedrijf dat het gerelateerde ‘prompt-patroon-activiteit’ bij meer dan 15.000 gebruikers had geïdentificeerd. De campagne werd op 28 juli 2026 volledig verstoord.

De AI-parvenu typeerde de activiteit als vijandige destillatie, een activiteit waarbij de resultaten van het ene model systematisch en ongeoorloofd worden gebruikt om een ​​ander model te helpen trainen, reproduceren of verbeteren. OpenAI zei dat het sindsdien aanvullende maatregelen heeft genomen om deze aanval te bestrijden en de frauduleuze accounts die bij de activiteit betrokken zijn, heeft verboden.

Bovendien zei OpenAI dat het een “pad” heeft afgesloten dat het voor sommigen die al over de gecodeerde redenering van een andere gebruiker beschikten mogelijk maakte om deze opnieuw af te spelen en de inhoud ervan te herstellen, naast het toevoegen van controles om gestreamde uitvoer te detecteren en vast te houden die de redenering zou kunnen blootleggen.

In een in augustus 2026 gepubliceerde studie ontdekte een groep onderzoekers een architectonische kwetsbaarheid die de gecodeerde redeneringssporen ‘volledig compatibel en uitwisselbaar maakte tussen verschillende sessies, gebruikers en modellen binnen het ecosysteem van een provider’, die een aanvaller zou kunnen misbruiken om een ​​schaalbare jailbreak voor decodering te ontwikkelen en anti-destillatiemechanismen te omzeilen.

“Door een gecodeerd redeneerspoor van een bepaald model in een zwakker en minder veilig model van dezelfde provider te injecteren, dwingen we het om het spoor woordelijk in platte tekst te decoderen en uit te voeren, zonder ooit het capabelere model rechtstreeks te jailbreaken”, aldus onderzoekers van MATS Research, ELLIS Institute Tübingen en Synk.

Bovendien maakt het grootschalige extractie van privégegevens mogelijk, opent het de deur voor onzichtbare promptinjecties door kwaadaardige ladingen volledig in gecodeerde blokken in te sluiten, en onthult het onbedoeld gevaarlijke informatie die verborgen is in het redeneringsproces, zelfs als de uiteindelijke, zichtbare uitvoer van het model een schadelijk verzoek afwijst.

Gezien het feit dat beschermd redeneren inzicht biedt in hoe een model zich een weg baant door een taak, kan het extraheren van deze informatie gevoelige gegevens onthullen en anderen helpen de mogelijkheden van het model te reproduceren, voegde OpenAI eraan toe.

“Tegenstrijdige distillatie brengt risico’s voor de veiligheid en de nationale veiligheid met zich mee”, aldus het bedrijf. “Geëxtraheerde redenering zou kunnen worden gebruikt om een ​​ander model te trainen zonder de waarborgen te behouden die zijn toegepast op de gebruikersgerichte outputs van het originele model.”

“Op grote schaal kan distillatie ook de overdracht van geavanceerde capaciteiten versnellen zonder dat dezelfde investeringen in veiligheid nodig zijn. Deze zorgen worden groter naarmate modellen meer mogelijkheden krijgen in domeinen voor tweeërlei gebruik.”

Dit is niet de eerste keer dat Moonshot AI te maken krijgt met beschuldigingen van distillatie. Vorige maand beschuldigde rivaliserende Anthropic Moonshot AI ervan heimelijk klantverzoeken door te geven aan Claude in plaats van deze te verwerken met Kimi, en vervolgens de reacties van Claude weer aan gebruikers weer te geven.

Het bedrijf zou ook een deel van deze uitwisselingen hebben behouden om zijn Chain of Thought (CoT)-model te trainen. De activiteit is gevolgd onder de naam GTG-16002.

Thijs Van der Does