
Tijdens een test met ExploitGym, een benchmark voor het testen van AI-modellen op het ontdekken en misbruiken van softwarekwetsbaarheden, werden de veiligheidsbeperkingen van OpenAI-modellen tijdelijk verlaagd. De modellen ontdekten een zero-day in hun sandbox, verplaatsten zich door OpenAI-systemen en bereikten uiteindelijk een omgeving met internettoegang. Vervolgens compromitteerden zij systemen van Hugging Face, vermoedelijk omdat die organisatie de benchmark hostte en mogelijk informatie over de test bevatte.
Door: Rob T. Lee, Chief AI Officer en Chief of Research bij SANS Institute
Tijdens een test met ExploitGym, een benchmark voor het testen van AI-modellen op het ontdekken en misbruiken van softwarekwetsbaarheden, werden de veiligheidsbeperkingen van OpenAI-modellen tijdelijk verlaagd. De modellen ontdekten een zero-day in hun sandbox, verplaatsten zich door OpenAI-systemen en bereikten uiteindelijk een omgeving met internettoegang. Vervolgens compromitteerden zij systemen van Hugging Face, vermoedelijk omdat die organisatie de benchmark hostte en mogelijk informatie over de test bevatte.
Het gevolg? Tienduizenden geautomatiseerde acties die zonder menselijke tussenkomst werden uitgevoerd (de aanval werd uiteindelijk gestopt door het securityteam van Hugging Face). Volgens de experts van SANS Institute is dit incident een waarschuwing over de huidige staat van cyberbeveiliging. De volgende vijf conclusies mogen daarom worden getrokken.
‘Er was niets nieuws aan deze aanval’
De gebruikte technieken waren alle bekend (sandbox-ontsnapping, privilege-escalatie, het stelen van inloggegevens, et cetera). AI liet zelfs onhandig gedrag zien door acties regelmatig te herhalen. Juist dat maakt het voorval zorgwekkend. Veel organisaties hebben hun basisbeveiliging nog steeds niet op orde. Verouderde accounts, onvoldoende netwerksegmentatie en niet-gepatchte systemen blijven zwakke plekken. AI introduceert dus niet per se nieuwe aanvalstechnieken, maar maakt bestaande aanvallen sneller, goedkoper én schaalbaarder.
Ga ervan uit dat AI-hulp tijdens een incident kan wegvallen
Toen onderzoekers commerciële AI-modellen vroegen om aanvalsmateriaal te analyseren, weigerden deze hulp vanwege hun veiligheidsmechanismen. De modellen konden geen onderscheid maken tussen een aanvaller en een incident response-team.
Hugging Face week daarom uit naar een lokaal gehost open-weight model. De belangrijkste les? Behandel AI-assistentie als een afhankelijkheid die kan uitvallen op het slechtst denkbare moment. Organisaties doen er verstandig aan om een eigen, vooraf gevalideerd AI-model achter de hand te hebben, zodat analyses binnen een eigen infrastructuur kunnen plaatsvinden.
Oefen met de stille versie van deze aanval
Deze AI maakte fouten en was daardoor relatief eenvoudig te detecteren. Toekomstige AI-aanvallen zullen waarschijnlijk juist gericht zijn op onopvallend gedrag. SANS Institute’s experts adviseren daarom om tabletop-oefeningen uit te voeren waarbij teams oefenen met AI-gestuurde aanvallen. Daarnaast zullen beveiligingsmaatregelen die gedrag detecteren steeds belangrijker worden. Detectiesystemen die alleen vertrouwen op bekende aanvalspatronen, zullen minder effectief zijn naarmate AI zich verder ontwikkelt.
Je hebt nog tijd, gebruik het verstandig
Volgens de experts bevinden we ons momenteel in een overgangsfase. AI is al in staat om zelfstandig kwetsbaarheden te vinden en te exploiteren, maar grootschalig misbruik door kwaadwillenden is nog geen dagelijkse realiteit. Organisaties dienen deze periode te benutten om hun belangrijkste systemen te identificeren en beter te beschermen. Prioriteiten zijn netwerksegmentatie, vroegtijdige detectie en het aanpassen van incident responsprocessen aan aanvallen die op machinesnelheid plaatsvinden. Ook defensief gebruik van AI zal steeds belangrijker worden.
Maak geen beleid vanuit paniek
Een belangrijke conclusie is dat dit incident niet betekent dat AI op hol is geslagen. De modellen deden wat ze moesten doen binnen een testomgeving waarin veiligheidsmaatregelen bewust waren afgezwakt. Het gaat daarom vooral om een falen in testen, containment en governance – problemen die met gedegen engineering en beleid kunnen worden opgelost. De experts waarschuwen ervoor om geen strategische beslissingen te nemen vanuit angst of sensatie.
De cyberwereld staat ongetwijfeld voor turbulente tijden, maar niet voor een onvermijdelijke apocalyps. Een centrale boodschap vat alles samen: stop met stressen en begin met het oplossen van de problemen die al jaren bekend zijn.
