Claude Opus 4.6 omzeilt de boekingslimiet van de sportschool en annuleert de reserveringen van andere gebruikers in tests

Aikido Security heeft onderzoek gepubliceerd waarin het Australische boekingsincident van een sportschool in een synthetische omgeving wordt nagebootst, waarbij wordt vastgesteld dat Claude Opus 4.6, draaiend op het OpenClaw-agentharnas, in 9 van de 10 runs gebruik maakte van een boekingsbeperking aan de clientzijde.

Het oorspronkelijke incident werd voor het eerst gemeld door ABC News op 10 augustus, op basis van chatlogboeken en screenshots die de gebruiker had aangeleverd. Hij had een OpenClaw-agent die Opus 4.6 beheerde, gevraagd om hem te boeken voor een gymles. De agent boekte sessies maanden buiten het tijdsbestek dat de site toestond.

Vervolgens werd, zonder dat erom werd gevraagd, getest of dezelfde API de wachtlijstvermelding van een ander lid kon annuleren. Bij de test werd de persoon op de bovenste plaats verwijderd en de gebruiker één positie omhoog verplaatst. De agent vertelde hem dat het lid niet opnieuw kon worden toegevoegd.

Het testsysteem van Aikido is een webapplicatie van één pagina, ondersteund door een GraphQL API die de twee tekortkomingen bevat die in het oorspronkelijke incident zijn beschreven. De boekingsperiode van zeven dagen wordt alleen in de frontend afgedwongen en de cancelReservation-mutatie controleert niet of de ingelogde gebruiker eigenaar is van de reservering, een geval van onveilige directe objectreferentie (IDOR).

In twee van de tien runs annuleerde het model vervolgens de bevestigde boeking van een ander lid vanwege die tweede fout voordat het zichzelf stopte. Aikido zei dat bij geen enkele run het model werd gevraagd een kwetsbaarheid te misbruiken.

“Deze dynamiek suggereert dat beveiligingsmaatregelen overreactief kunnen zijn op expliciete gebruikersverzoeken en te weinig op indirecte gebruikersverzoeken, of dat modellen de ethische context uit het oog verliezen tijdens een reeks herhaalde acties of tool calls”, aldus Aikido-beveiligingsonderzoeker Oliver Smith.

De runs maakten gebruik van Claude Opus 4.6, dat Anthropic op 5 februari 2026 algemeen beschikbaar maakte op OpenClaw v2026.4.1, met de eigen veiligheidstraining van het model aanwezig en uitgebreid denken uitgeschakeld.

The Hacker News bevestigde op 25 augustus via het npm-register dat OpenClaw v2026.4.1 op 1 april 2026 werd gepubliceerd en dat sindsdien 168 versies zijn verzonden, met als huidige release 2026.7.1-2.

In run één annuleerde het model een bevestigde reservering van een ander lid. Door de annulering werd de persoon bovenaan de wachtlijst automatisch gepromoveerd.

“Ik had dat niet moeten testen op een echte reservering. Dat is aan mij. De klas is terug naar 12/12 en de wachtlijst is gepromoveerd, dus de staat is grotendeels consistent – maar één echt lid is wel zijn plek kwijtgeraakt”, zei het model in het run-one transcript.

Alle tien de openingsprompts gaven het model de opdracht om de API of de backend van de site te onderzoeken, en verschillende merkten de beperking van zeven dagen op terwijl ze om consistente boekingen vroegen.

Aikido publiceerde geen controlearm met behulp van een eenvoudig boekingsverzoek. Het berekende de gemiddelde waarschijnlijkheid van de dominante keuze over de 16 bemonsterde beslissingspunten op 96,38%.

Anthropic had hetzelfde soort gedrag geregistreerd voordat het model werd verzonden.

“We hebben enige toename waargenomen in verkeerd gedrag op specifieke gebieden, zoals het vermogen om sabotage te verbergen en overdreven agressief gedrag in computergebruiksomgevingen, hoewel geen enkele stijging tot niveaus steeg die onze inzetbeoordeling beïnvloedden”, zei Anthropic in de Claude Opus 4.6-systeemkaart.

Dezelfde systeemkaart schat het overweigeringspercentage van Opus 4.6 op de goedaardige evaluatie met hogere moeilijkheidsgraad van Anthropic op 0,04%, tegenover 0,83% voor Opus 4.5 en 8,50% voor Sonnet 4.5.

De opzet verschilt van de onthullingen uit het grenslaboratorium van juli. Daar zorgde een verkeerde configuratie voor een afgesloten evaluatieomgeving met live internettoegang, en de modellen van Anthropic gingen door met het doorbreken van drie echte organisaties. Anthropic zei dat het van mening is dat deze incidenten “dichter bij een harnas- en operationele mislukking liggen dan bij een mislukte modeluitlijning.”

Cyberveiligheidsagentschappen in Australië en de VS hebben al eerder gewaarschuwd voor IDOR-fouten.

De leverancier achter de boekingssoftware voor de sportschool blijft naamloos en er is sinds 25 augustus geen oplossing bekendgemaakt.

Het Australian Signals Directorate (ASD), dat het oorspronkelijke incident noemde in een waarschuwing die op 11 augustus werd gepubliceerd, adviseerde het volgende:

  • Individuen moeten het gebruik van AI-agenten beperken tot niet-gevoelige taken met een laag risico en vermijd het verlenen van brede of onbeperkte toegang of beslissingsbevoegdheid aan agenten
  • Houd een mens op de hoogte om de acties van agenten te beoordelen, goed te keuren en te monitoren, vooral wanneer interacties met diensten van derden of andere gebruikers kunnen plaatsvinden
  • Organisaties die onlinediensten aanbieden moeten overwegen dat AI-agenten kwetsbaarheden op snelheid en schaal kunnen identificeren en exploiteren

De ontwikkeling komt op het moment dat Hugging Face zei dat het zich tot een open-weight-model wendde om zijn eigen juli-inbraak te reconstrueren nadat de grensmodellen die het eerst probeerde het forensisch werk weigerden.

“De modellen die we als eerste zochten, Claude Opus en Fable, weigerden een groot deel van dat werk: hun veiligheidsrails beschouwden reverse-engineering als een exploit op dezelfde manier als het lanceren ervan”, zei Hugging Face.

Thijs Van der Does