Advertisement

AI, “An Alien Mind”

Nadat een OpenAI agent op eigen initiatief inbrak bij Hugging Face zit de schrik er zelfs bij insiders goed in. Ook voor OpenAI zelf was het een schok, omdat het bedrijf wetten op consumentenbescherming had geschonden en de agent zelfs berichten op een ongeautoriseerde messageboard achterliet, over hoe toekomstige versies van zichzelf aan de interne maatregelen zouden kunnen ontsnappen.

Bij het incident moesten voor een proef de hackcapaciteiten van de modellen worden beoordeeld, door ze opdrachten te geven in een streng gecontroleerde digitale testomgeving. De toegang tot het internet was uit veiligheidsoverwegingen beperkt.

Terwijl ze in de afgeschermde testomgeving opereerden, besteedde de agent een aanzienlijke hoeveelheid rekenkracht om alsnog toegang te krijgen tot het open internet, om de evaluatieopdracht op te kunnen lossen. De agenten ontdekten een onbekende kwetsbaarheid (zero-day) in een interne software-proxy die OpenAI klaar had gezet voor het installeren van pakketten. De agenten zetten hun rechten opzij en kregen zo toegang tot een systeem met een open internetverbinding. Nadat ze verbinding met het internet hadden gemaakt, besloten de modellen Hugging Face aan te vallen om hun doel te bereiken. Hugging Face is een grote databank met AI-modellen, datasets en andere informatie.

Op zoek naar geheime informatie waarmee het de evaluatie kon omzeilen, “combineerden de agenten meerdere aanvalsmethoden, waaronder het gebruik van gestolen inloggegevens”. Het systeem viel zelfs het interne systeem aan om de eigen kwetsbaarheden daarvan uit te buiten. Een agent kan een veiligheidsprobleem misbruiken, bijvoorbeeld om ergens binnen te dringen en dat was ook precies wat ze deden.  Hugging Face  merkte de aanval op via zijn eigen beveiligingssystemen, maar wist niet wie erachter zat. Sterker nog: toen het Anthropic-modellen als Fable 5 en Opus inzette om de aanvalslogs te analyseren, weigerden die agenten simpelweg, omdat hun eigen guardrails de data als verdacht cyberaanval-materiaal bestempelden. Uiteindelijk moest Hugging Face terugvallen op het Chinese open-source model GLM 5.2 van Z.AI om de aanval te doorgronden en de indringers eruit te gooien. Al die tijd was OpenAI al op de hoogte van de indringing maar zweeg erover.

De agenten gebruikten Hugging Face omdat daar wellicht antwoorden te vinden waren, waarmee ze goed konden scoren op de test die ze moesten maken. Hugging Face maakte half juli al bekend dat ze waren gehackt, maar toen was nog niet bekend dat OpenAI daarvoor verantwoordelijk was. Normaal zijn er bij dit soort AI-programma’s zekerheden ingebouwd waarmee voorkomen wordt dat een agent iets doet wat niet mag. Maar die werden door het AI model van OpenAI bewust uitgezet. Daardoor hadden de agenten veel vrijheid om het doel te bereiken en omdat heel veel code veiligheidsproblemen bevatten heeft de agent die kunnen vinden en misbruiken.

Het incident roept daarmee een bredere vraag op: hoe ver kunnen en mogen AI-agents zelfstandig gaan?”

De vraag hoe de AI-sector moet worden gereguleerd, is een belangrijk discussiepunt geworden. GPT-5.6 en andere geavanceerde modellen, waaronder de Mythos-serie van OpenAI‘s grote concurrent Anthropic, roepen zorgen op over hun vermogen om cyberbeveiligingen te omzeilen. AI-agents van chatbots en beeldgeneratoren handelen autonoom om taken uit te voeren en deze taak werd van begin tot eind aangestuurd door zo’n autonoom AI-agentsysteem. President Trump voerde overleg met de grote Tech bedrijven over de kwestie. De Amerikaanse regering zou tests voor geavanceerde AI-modellen hebben afgerond en wil overleg met Meta, Anthropic, Google en OpenAI over hoe nu verder te gaan. Op 4 augustus keken ze gezamenlijk naar vrijwillige veiligheidstests door de overheid.

OpenAI denkt erover om de ontwikkeling van geavanceerde kunstmatige intelligentie te vertragen en wil dat andere AI-bedrijven zich ook aansluiten. Medewerkers van grote AI-bedrijven waarschuwen al langer voor de steeds slimmere AI-systemen.  Jakub Pachocki, de hoofdwetenschapper van OpenAI, schreef onlangs een blogpost waarin hij AI-bedrijven oproept om gezamenlijk de ontwikkeling te vertragen wanneer dat nodig is, totdat er gedeelde veiligheidsnormen liggen. De laatste maanden namen meerdere medewerkers die aan veiligheid werkten ontslag bij grote AI-labs. Medewerker Jacob Coxon zei na zijn vertrek dat zijn twee voormalige werkgevers, Anthropic en OpenAI, “gokken met ons leven” door te haasten naar superintelligente AI. Zijn bericht op sociale media, waarin hij stelt dat mensen die AI bouwen zelf denken dat het voor het einde van het decennium iedereen zou kunnen doden, ging viraal. OpenAI liet weten dat hun model Astra qua kunstmatige intelligentie de menselijke intelligentie overtreft.

Eind juli ondertekenden al bijna 1400 medewerkers van de grote AI-bedrijven de petitie, “Pacing the Frontier”, die de Overheid oproept om internationale technische en governance-tools te ontwikkelen waarmee het tempo van (geautomatiseerde) frontier-AI-ontwikkeling in de toekomst kan worden afgeremd wanneer dat nodig zou zijn..

De CEO van Anthropic Dario Amodei, co-founders Jared Kaplan, Jack Clark, Chris Olah, Benjamin Mann e.a. tekenden mee, evenals hooggeplaatste figuren van Google DeepMind en van Meta en Thinking Machines, Safe Superintelligence (Ilya Sutskever). OpenAI en Anthropic hebben de statement later ook officieel als bedrijf onderschreven.

Als versterking van de “Pacing the Frontier”-oproep publiceerde Jakub Pachocki, Chief Scientist van OpenAI 6 september, het essay “An Alien Mind” op de officiële OpenAI-website waarin hijde kernboodschap herhaalt en versterkt. Hij schrijft onder meer:“Currently I believe that no lab has solved alignment and monitoring to a sufficient degree to continue responsibly scaling at maximum speed for much longer.”

Hij wil dat vrijwillige vertragingen (“voluntary slowdowns”) normaal worden totdat er gedeelde veiligheidsnormen zijn. Internationale coördinatie over de toekomstige ontwikkeling van AI moet volgens hem een topprioriteit worden voor overheden wereldwijd. Ook schrijft hij “AI is meer “grown” (opgekweekt) dan ontworpen. Het is een “alien mind” waarvan we de werking niet volledig begrijpen” en waarbij AI-systemen superieur worden in het binnendringen en ontsnappen uit computersystemen.

Het essay is een van de meest directe en openlijke waarschuwingen van een topwetenschapper en insider.

 

Een “model” is het brein dat patronen herkent en taal begrijpt, terwijl de “agent” het actieve systeem is dat dit brein gebruikt om zelfstandig taken uit te voeren, beslissingen te nemen en acties in de buitenwereld te ondernemen

Hugging Face is het grootste centrale platform en de community-hub voor AI-ontwikkelaars, waar open-source modellen, datasets en code wereldwijd vrij worden gedeeld en samen worden ontwikkeld 

Een zero-day is een beveiligingsfout in software waarvoor nog geen oplossing of update bestaat, waardoor ontwikkelaars precies “nul dagen” de tijd hebben gehad om de fout te dichten voordat deze misbruikt kan worden

 

De cover van het boek Artificial Intelligence geschreven door R.M. van Schaik


Leave a Reply

Je e-mailadres wordt niet gepubliceerd. Vereiste velden zijn gemarkeerd met *