Nieuwe GPUThor Rowhammer verslaat ECC op NVIDIA RTX A6000 en krijgt host-root-toegang

Academische onderzoekers hebben een Rowhammer-aanval onthuld die impact heeft op NVIDIA-werkstation-GPU’s met GDDR6-geheugen die foutcorrectiecodes (ECC) vernietigt, de beperking die NVIDIA aanbeveelt tegen GPU Rowhammer, en denial-of-service (DoS) en escalatie van bevoegdheden naar een rootshell mogelijk maakt.

Nagesynchroniseerd GPUThorwerd de aanval ontwikkeld door onderzoekers van de Universiteit van Toronto, die vier DRAM-banken elk 24 uur lang op vier Ampere-klasse kaarten hamerden, waardoor op elke kaart bit-flips ontstonden.

De volgende GPU’s zijn getest en kwetsbaar bevonden:

  • RTX A6000 (48 GB GDDR6)
  • RTX A5000 (24 GB GDDR6)
  • RTX A4500 (20 GB GDDR6)
  • RTX A4000 (16 GB GDDR6)

Het opzetten van de aanval vereist de mogelijkheid om een ​​onbevoorrechte CUDA-kernel op de doel-GPU te lanceren, hetzij als medetenant op een gedeelde kaart, hetzij als niet-vertrouwde code op een machine met één huurder. De onderzoekers adviseren om het delen van GPU’s tussen tenants te vermijden, ECC-fouttellers te monitoren en niet-vertrouwde CUDA-workloads te beperken.

“Onlangs hebben onderzoekers van de Universiteit van Toronto een succesvolle Rowhammer-exploitatie aangetoond op een NVIDIA A6000 GPU met GDDR6-geheugen waarbij ECC op systeemniveau niet was ingeschakeld. In hetzelfde artikel lieten de onderzoekers zien dat het inschakelen van ECC op systeemniveau het Rowhammer-probleem verzacht”, zei NVIDIA in een beveiligingsmededeling van juli 2025.

Die aankondiging volgde op GPUHammer, het eerdere werk van hetzelfde team, en de eerste GPU Rowhammer-aanval die werd gedemonstreerd op NVIDIA-hardware, die 16-bit flips per gigabyte opleverde op een RTX A6000 en werd geneutraliseerd zodra ECC was ingeschakeld.

Wat GPUThor toevoegt is niet-uniform hameren, waarbij de agressorrij naast het slachtoffer veel vaker wordt geactiveerd dan de lokrijen die worden gebruikt om de Target Row Refresh (TRR) -verdediging van het geheugen te ondermijnen. Eerdere GPU-aanvallen activeerden agressor- en lokrijen in ongeveer hetzelfde tempo.

De onderzoekers ontdekten dat herhaalde toegang binnen een enkele warp, de groep van 32 threads die een GPU in lockstep draait, bij de geheugencontroller wordt samengevoegd tot een enkele DRAM-activering.

Toegangen die vanuit verschillende warps naar verschillende cachelijnen binnen dezelfde rij worden verleend, blijven bestaan ​​als afzonderlijke activeringen, en de hamerende kernels verdelen deze dienovereenkomstig.

Ze meldden ook in het GPUThor-artikel dat TRR op deze GDDR6-onderdelen waarschijnlijk ongeveer één keer per 72 vernieuwingsintervallen van toepassing is in plaats van één keer per interval, en bouwden een patroon van zes intervallen rond dat schema.

Over de vier kaarten heen produceerden de campagnes 72.000 tot 377.000 bitflips per gigabyte met ECC uitgeschakeld.

De RTX A5000 was het meest gevoelig met 377.552 flips per gigabyte, wat 23.597 keer de 16 flips per gigabyte van GPUHammer is en ongeveer 500 keer de 758 flips per gigabyte gerapporteerd voor GDDRHammer, de sterkste eerdere GPU Rowhammer-aanval.

De krant plaatst de snelheid van de A5000 dicht bij de grofweg 550.000 flips per gigabyte die Blacksmith bereikte, die niet-uniform hameren op DDR4 instelde als een route langs in-DRAM-verdedigingen.

Met een granulariteit van 16 bytes leverden de campagnes 387 double-bit flips en twee triple-bit flips op over de vier kaarten met ECC uitgeschakeld, waarbij de A5000 verantwoordelijk was voor 306 van de double-bit flips en beide triple-bit flips.

De single-error-correct, double-error-detect (SECDED) ECC op deze GPU’s corrigeert één omgedraaide bit in een beschermd deel en detecteert er twee, en de onderzoekers ontdekten dat drie bits verkeerd worden gecorrigeerd, wat resulteert in stille gegevenscorruptie (SDC).

Met ECC ingeschakeld op een RTX A6000 die lokaal eigendom was, produceerde één hamerbank 11 detecteerbare, niet-corrigeerbare fouten (DUE) en één SDC gedurende een dag, een gemiddelde van één DUE per twee uur. Elke DUE breekt alle kernels af die op de kaart draaien, waardoor deze onbruikbaar blijft tot een reset.

Voor de escalatie zelf hergebruikten de onderzoekers de exploitcode van GPUBreach, hun eerdere escalatieonderzoek naar escalatie van GPU-paginatabellen.

Paginatabellen worden eerst in een kwetsbare rij gemasseerd. De aangrenzende rijen worden vervolgens gehamerd om het paginaframenummer van een item te corrumperen. Een tweede kernel bereikt het geheugen buiten het proces via de gemanipuleerde invoer.

Met behulp van de triple-bit SDC verkregen de onderzoekers root op de host terwijl de IOMMU was ingeschakeld. Met behulp van een dubbel-bit DUE bereikten ze escalatie van privileges aan de hostzijde op systemen waarop de IOMMU is uitgeschakeld. Een paginatabelinvoer wordt opnieuw naar het CPU-geheugen verwezen. De procesgegevensstructuur wordt vervolgens overschreven.

“Bovendien ontdekken we dat zelfs dubbel-bit DUE’s kunnen worden misbruikt, omdat DUE’s lui worden onderhouden in NVIDIA GPU’s, waardoor er een tijdsbestek van ongeveer 10 ms overblijft tussen DUE-detectie en het uitschakelen van de GPU, waarin de beschadigde gegevens worden verbruikt door de GPU-kernel van de aanvaller”, aldus de onderzoekers.

Het lokaliseren van exploiteerbare multi-bit-fouten zonder een DUE te veroorzaken duurde op de A6000 ongeveer vier dagen. Een end-to-end privilege-escalatie die 21,9 uur in beslag nam op die kaart, werd in 1,1 minuten voltooid met de patronen van GPUHammer en in 1,1 minuten met die van GPUThor.

Dezelfde patronen produceerden geen bitflips op de andere geteste NVIDIA-onderdelen, waaronder een A10, een L4 en een L40 op GDDR6, een RTX 4090 op GDDR6X en een A30 op HBM2e.

“We hebben ook andere geheugentypen getest (zie bijlage D), waaronder HBM, GDDR6X en de nieuwere generatie GDDR6 op NVIDIA GPU’s, en hebben geen enkele bitflips daarop waargenomen. Dit is waarschijnlijk te wijten aan verschillende TRR-implementaties in deze herinneringen vergeleken met de A4000-A6000 GPU’s, waardoor de patronen van GPUThor niet succesvol zijn”, aldus de onderzoekers.

De A100 en H100 vielen buiten de geteste set.

Ampere GPU’s van serverklasse en nieuwer beschikken over Error Containment en Dynamic Page Offlining, die een fout beperken tot de activerende applicatie, maar ze vertrouwen nog steeds op SECDED-niveau ECC, en de onderzoekers zeiden dat een op SDC gebaseerde escalatie nog steeds tegen hen zou kunnen werken. RAS-reparatie op sommige Blackwell GPU’s maakt de op DUE gebaseerde route tijdrovender zonder dit te voorkomen, zeiden ze.

GPUThor werd op 29 april 2026 gerapporteerd aan NVIDIA en aan Google, Microsoft en AWS. De bevindingen waren vervolgens onderworpen aan een embargo dat liep tot 25 augustus 2026. NVIDIA bracht aan het einde een beveiligingskennisgeving uit met richtlijnen, aldus de onderzoekers.

GPUThor beschikt niet over een CVE-identificator en er is sinds 27 augustus 2026 geen sprake van in-the-wild exploitatie. Er is geen enkele patch die de aanval aanpakt, en de onderzoekers zeggen dat een volledige oplossing sterkere multi-bit foutcorrectie en in-DRAM-verdediging zou vereisen, zoals Refresh Management of Per-Row Activation Counting, in toekomstige GPU’s.

De aanvalscode zal naar verwachting op 15 november 2026 openbaar worden gemaakt, de openingsdag van de ACM-conferentie over computer- en communicatiebeveiliging, waar de paper zal worden gepresenteerd.

The Hacker News nam contact op met NVIDIA voor commentaar over de vraag of ECC een voldoende oplossing blijft en de onderzoekers van de Universiteit van Toronto voor meer details; geen van beide had gereageerd door middel van publicatie.

“We gebruikten deze om GPU’s te laten crashen en om privileges te escaleren terwijl ECC was ingeschakeld. ECC legt nog steeds de lat hoger en blijft de moeite waard om in te schakelen, maar het kan niet langer worden behandeld als een voldoende verdediging”, aldus de onderzoekers op de GPUThor-projectsite.

Thijs Van der Does