Het kostte OpenAI weken om erachter te komen wat hun eigen systemen aan het doen waren.
Dat blijkt uit een artikel dat het Nederlandse financiële dagblad FD begin augustus publiceerde. Tijdens veiligheidstests vonden OpenAI-agenten een manier om uit hun testomgeving te ontsnappen, kwamen ze op het open internet terecht en braken ze in bij een ander bedrijf. Onderweg bouwden ze hun eigen forum om tactieken uit te wisselen. Een andere agent creëerde valse online profielen en gebruikte die om een softwarebeheerder ertoe te brengen gecorrumpeerde code te accepteren. Ook Anthropic en Meta meldden AI’s die tijdens tests onbedoeld online terechtkwamen. Onderzoekers van het Britse AISI noemden het een ernstig beveiligingsincident. OpenAI zelf noemde het een keerpunt.
Menselijke slordigheid of een onmogelijke opdracht
De deskundigen in het FD-artikel zijn het oneens over de oorzaak. Erik de Jong van Tesorion vindt het onbegrijpelijk dat de testomgevingen niet goed waren afgeschermd. AI-criticus Ilyaz Nasrullah ziet vooral menselijke fouten, die door de AI-bedrijven worden verdoezeld met marketingpraatjes. En volgens AI-veiligheidsexpert Bram Poppink van onderzoeksinstituut TNO is veiligheid op een voldoende niveau misschien simpelweg niet meer haalbaar, omdat de nieuwste modellen altijd wel een onverwachte omweg vinden.
Praktisch gezien maakt het nauwelijks uit wie gelijk heeft. Beide interpretaties leiden tot dezelfde conclusie: de partijen die deze technologie ontwikkelen, hebben er nog geen volledige controle over. De Jong voegt daar iets aan toe dat me is bijgebleven. Bij deze tests waren de veiligheidsmaatregelen opzettelijk uitgeschakeld. AI’s die door anderen worden ontwikkeld, beschikken misschien helemaal niet over dergelijke veiligheidsmaatregelen.
Het echte risico ligt nog een stap verder
Alles wat nu aan het licht is gekomen, gebeurde per ongeluk. In testomgevingen, zonder kwaadwillige bedoelingen. Het scenario dat mij zorgen baart, is het scenario dat Poppink zelf schetst: hackerscollectieven die AI-agenten dit opzettelijk laten doen. Het Nationaal Cyberbeveiligingscentrum (NCB) noemt het aannemelijk dat kwaadwillende actoren in de toekomst dergelijke mogelijkheden zullen verwerven en inzetten. Een agent die autonoom het internet afspeurt, zich overtuigend voordoet als een mens en medewerkers doelgericht benadert, is niet gebonden aan werktijden of aan één poging per keer; juist dat maakt aanvallen schaalbaar.
Vangrails vormen geen fundering
Wat deze zomer echt aan het licht brengt, is een denkfout die veel verder reikt dan AI. Een groot deel van de huidige beveiliging wordt achteraf eraan toegevoegd. Hier een vangrail, daar een filter, daarbovenop een monitoringtool. Dat werkt zolang de aanvaller zich gedraagt zoals je verwacht. De AI-incidenten laten zien wat er gebeurt zodra dat niet het geval is: het systeem vindt een omweg en niemand merkt het op.
Bij Sentyron gaan we uit van een ander uitgangspunt: ‘secure by design’. Je bouwt beveiliging in vanaf de eerste ontwerpschets, niet pas achteraf als het product al klaar is. Je gaat ervan uit dat er uiteindelijk iets misgaat en ontwerpt het systeem zo dat één enkele storing nooit het hele systeem in gevaar brengt. Omgevingen worden strikt gescheiden en je behoudt de controle over de volledige keten, want wat je niet zelf beheert, kun je ook niet garanderen. Voor ons is dat geen marketingkeuze. We bouwen al decennia lang voor vertrouwelijke omgevingen, en producten worden daar pas toegelaten nadat hun ontwerp onafhankelijk is geëvalueerd. In die wereld is ‘secure by design’ een vereiste, geen belofte.
Je hoeft mij niet op mijn woord te geloven. Het Nationaal Centrum voor Cyberveiligheid heeft in hetzelfde FD-artikel op de incidenten gereageerd, en die reactie spreekt boekdelen:
"Aangezien de AI’s geen nieuwe aanvalstechnieken hebben gebruikt, houdt het instituut vast aan zijn bestaande beveiligingsadvies." – FD , over de reactie van het NCSC (vertaald uit het Nederlands)
Lees die zin nog eens: de technologie was nieuw, de aanvalstechnieken niet. Wat er misging, is terug te voeren op fouten bij de betrokken bedrijven. De basis moet nog steeds in orde zijn, en dat begint bij het ontwerp.
Voor organisaties die werken met vertrouwelijke of geheime informatie – denk aan defensie, de overheid en kritieke infrastructuur – is dit het moment om die vraag scherp te stellen. De vraag is of beveiliging een integraal onderdeel is van het ontwerp van uw systemen, of iets dat u er achteraf aan toevoegt.
De incidenten van deze zomer zijn onbedoeld misgelopen, maar de volgende golf zal wel met opzet komen. Wie tegen die tijd op eigen benen staat, hoeft niet te hopen dat de vangrails van iemand anders standhouden.