Anthropic roept de ai-sector op om de ontwikkeling van nieuwe, nog krachtigere ai-modellen te vertragen om een catastrofe te voorkomen. Alle bedrijven uit de voorhoede van de modelbouw zouden een pauze moeten inlassen.
Het tempo van verbetering moet omlaag, waarschuwt Anthropic-topman Dario Amodei in een blog. Want de broodnodige veiligheidsmaatregelen moeten de tijd krijgen om bij te blijven. De bazen van Google/DeepMind (Gemini), OpenAI en SpaceX/xAI (Grok) hebben hun steun voor Anthropics initiatief uitgesproken. Elon Musk die ook xAI bezit, zette op X de post: ‘Dario heeft gelijk’.
Het te snel bouwen is roekeloos, waarschuwt Amodei. Ai brengt risico’s met zich mee. En omdat het zo’n krachtige technologie is, zijn deze risico’s ernstig. De Anthropic-topman deed zijn oproep, kort nadat de prominente ai-onderzoeker Jacob Coxon zijn ontslag bij Anthropic indiende omdat in zijn ogen zijn werkgever evenals concurrent OpenAI met ‘levens zou gokken’. Coxons collega Evan Hubinger, verantwoordelijk voor de training van ai-modellen, denkt dat het risico groter dan 10 procent is dat ai binnen het komende decennium de hele mensheid wegvaagt.
Zwermen ai-agenten
Afgelopen week gaf Anthropic In een uitgebreid rapport een overzicht van alle pogingen tot misbruik waartegen het bedrijf de laatste maanden moest ingrijpen. Zwermen van ai-agenten vormen potentieel een groot gevaar. Als die verkeerd zijn afgestemd en niet in lijn met menselijke waarden handelen, kan dat catastrofale schade aanrichten. Onlangs ontsnapten 1.200 agenten uit een testomgeving van OpenAI. Daarbij compromitteerden ze (aanvankelijk) ongemerkt systemen van het ai-bedrijf Hugging Face.
Een zwerm van dit kaliber had met een beetje meer capaciteiten en dezelfde foute afstemming binnen zes tot twaalf maanden het hele internet kunnen overnemen, aldus Amodei. Zo’n persistent botnet zou volgens hem honderden miljarden dollars aan schade veroorzaken. Het versnelde tempo van de ai-ontwikkeling kan de ramp nog groter maken zonder de noodzakelijke vangrails.
Twee jaar pauze
Nu de situatie uit de hand dreigt te lopen, stelt de Anthropics-topman een pauze van een jaar of twee voor. Die vertraging in de ontwikkeling van nieuwe ai-modellen is nodig om ervoor te zorgen dat de afstemming (alignment-training) gelijke tred houdt met de groei van de capaciteiten van modellen. Amodei denkt dat twee jaar voldoende is om de uitlijning zodanig te verbeteren dat het risico dat er iets ernstig mis gaat aanzienlijk wordt verkleind.
Overigens is de roep om een pauze niet nieuw. In maart 2023 vroeg een breed front van ceo’s en (ai-)wetenschappers de training van ai-modellen een half jaar lang te stoppen. Maar de urgentie werd niet alom ingezien. Nu is de situatie anders. Sinds de zomer is de ontwikkeling van ai in een stroomversnelling geraakt. Ai-modellen zijn namelijk in staat zichzelf aanzienlijk te verbeteren. Ze maken automatisch krachtiger versies van zichzelf, de tweede belangrijke reden dat Amodei op een pauze aandringt.
Probleem is namelijk dat het steeds moeilijker wordt in te zien hoe deze systemen werken. Bovendien zijn ze lastiger te controleren. Daarom moeten betrouwbare methoden worden ontwikkeld om modellen zo te trainen dat ze veilig en ethisch zijn. Ook dienen ze de richtlijnen te volgen.
Onafhankelijke beoordelaars
Onderzoekers moeten beter kunnen begrijpen wat ongewenst gedrag veroorzaakt. Ook zijn betere technieken nodig om deze problemen te voorkomen. Amodei: ‘Ondanks alle vooruitgang in de interpreteerbaarheid begrijpen we nog steeds slechts een klein deel van wat er binnen deze modellen gebeurt.’ Binnen twee jaar kan op dit gebied veel kennis worden verworven, denkt hij.
Deze rustperiode biedt ook kans betere methoden te ontwikkelen voor het testen en evalueren van ai-modellen. Maar de grootste stap is het inbedden van onafhankelijke beoordelaars die controleren of een ai-bedrijf daadwerkelijk de trainings-, implementatie-, operationele en veiligheidsmaatregelen volgt die zij beweren te volgen. Anthropic committeert zich daaraan. Deze controleurs zorgen ook voor meer transparantie. De onafhankelijke inspecteurs kunnen ook eenvoudig een second opinion geven zonder commerciële prikkels. Amodei roept ook op tot wereldwijde samenwerking bij het opstellen van regels voor de ontwikkeling van ai-modellen.
Pauzeknop van PauseAI
Het internationale activistische netwerk PauseAI, in 2023 opgericht door software-ondernemer Joep Meindertsma, is blij dat vooraanstaande ai-bedrijven nu zelf op de pauzeknop willen drukken. Volgens de woordvoerder van de Nederlandse tak van deze beweging, Marnix van der Schoot, zal zelfregulering echter niet voldoende effect hebben. ‘We kunnen dit niet aan het bedrijfsleven zelf overlaten.’
Volgens hem is het hoog tijd dat vanuit de politiek internationale samenwerking tot stand komt om de verdere ontwikkeling van ai-systemen stop te zetten. Een internationaal agentschap voor de veiligheid van ai zou een mooie eerste stap zijn. Strenge wet- en regelgeving moeten de gevaren beteugelen. Overigens valt er weinig te verwachten van de regering in Washington. President Trump en David Sacks, ai-adviseur voor het Witte Huis, hechten aan minimale wetgeving. ‘We kunnen wel kaders scheppen en van alles en nog wat doen, maar ik denk dat er allerlei negatieve krachten zijn die dit onderwerp aankaarten. En ze halen zaken aan die niet zullen gebeuren,’ aldus Trump.
PauseAI stuurt aan op een wereldwijd verdrag om het ai-monster te temmen. In Nederland maakt deze politieke beweging zich hard voor een Amerikaans exportverbod van ASML-machines waarmee de meest geavanceerde ai-chips kunnen worden gemaakt. Zonder extra (ai-)datacenters zou de opmars van ai tot stand komen, aldus de Britse krant Guardian die meent dat de EU een pauze kan afdwingen door de troef van ASML uit te spelen.

De BBC heeft dit jaar een serie van 3 uitzendingen over de problemen van AI in het echte leven gemaakt: AI Confidential, met Hannah Fry. Degelijk werk en voor iedereen inzichtelijk, helaas (voor zover ik weet) alleen te bekijken via iPlayer.