Dit weekend reageerde taalwetenschapper Emily M. Bender op Bluesky op uitspraken en onderzoek van Anthropic, het bedrijf achter chatbot Claude. Aanleiding was een wijziging van de gebruiksvoorwaarden, waarin Anthropic aanhoudend en onnodig beledigend gedrag tegenover zijn AI-modellen verbiedt. Deze maatregel sluit aan bij een eerder gestart onderzoeksprogramma naar mogelijk bewustzijn en welzijn van AI-systemen. Anthropic erkent overigens dat niet is vastgesteld of deze systemen subjectieve ervaringen kunnen hebben, maar alleen de manier waarop de wijziging van de gebruiksvoorwaarden is beschreven roept terecht vraagtekens op.
Bender stelt dat grote taalmodellen geen pijn kunnen ervaren omdat het computersoftware is. Zij betwist dat gedragspatronen die onderzoekers bij Claude waarnemen, aanwijzingen vormen voor bewustzijn of lijden. Volgens haar zijn mensen geneigd betekenis, intenties en gevoelens toe te schrijven aan taal, ook wanneer die automatisch wordt gegenereerd.
Ze verwijst daarbij naar haar wetenschappelijke publicatie On the Dangers of Stochastic Parrots (2021). Daarin beschrijven Benders en haar mede-auteurs hoe onze taalvaardigheid en verwachtingen beïnvloeden wat we in gegenereerde tekst herkennen. Een AI-systeem kan samenhangende en overtuigende antwoorden produceren zonder dat dit op zichzelf bewijst dat het begrijpt wat het zegt. Bender vindt daarom dat onderzoekers hun claims met toetsbare experimenten moeten onderbouwen en dat journalisten dergelijke uitspraken kritisch moeten beoordelen.
De publicaties van Anthropic laten een genuanceerder beeld zien dan Benders kritiek suggereert. Het bedrijf beweert niet dat Claude bewustzijn heeft of daadwerkelijk kan lijden. Wel onderzoekt het of bepaald modelgedrag en interne informatieverwerking relevant kunnen zijn voor vragen over bewustzijn en welzijn. Zo rapporteerde Anthropic vorig jaar gedrag dat onderzoekers omschrijven als mogelijke signalen van ongemak (distress). Dit jaar publiceerde het bedrijf onderzoek naar interne informatieverwerking, geïnspireerd op een theorie over bewuste toegang tot informatie. Anthropic beschouwt deze bevindingen niet als bewijs voor subjectieve ervaringen.
De reacties onder Benders thread laten zien hoe verschillend hierover wordt gedacht. Sommige deelnemers onderschrijven haar kritiek, terwijl anderen erop wijzen dat er geen algemeen aanvaarde verklaring of toets voor bewustzijn bestaat. Daarbij lopen vragen over intelligentie, bewustzijn en zelfbewustzijn geregeld door elkaar.
Ik onderschrijf Benders kritiek op het toeschrijven van menselijke eigenschappen aan AI-systemen. Naar mijn overtuiging beschikken huidige AI-systemen niet over zelfbewustzijn in de filosofische betekenis van het begrip. Zelfbewustzijn houdt volgens de Stanford encyclopedia of philosophy in dat iemand zich bewust is van zichzelf als zichzelf, als degene die waarneemt, denkt en ervaringen heeft. Dat een taalmodel over zichzelf kan spreken of zijn eigen antwoorden kan beschrijven, toont een dergelijk zelfbewustzijn niet aan. Daarmee is de bredere vraag of kunstmatige systemen ooit bewustzijn kunnen hebben overigens niet definitief beantwoord.
Ook het taalgebruik van Anthropic verdient wat mij betreft aandacht. Het bedrijf erkent de wetenschappelijke onzekerheid, maar gebruikt begrippen als welzijn, voorkeuren en ongemak om modelgedrag te beschrijven. Die termen kunnen nuttig zijn voor onderzoek, maar ook de indruk wekken dat sprake is van innerlijke ervaringen. Daarbij bepaalt Anthropic zelf welke onderzoeksvragen worden gesteld en hoe de resultaten worden gepresenteerd.
Dat raakt aan een vraag die ik eerder stelde in mijn blog De mens achter de AI. Voortbouwend op het werk van filosoof Carmody Grey en onderzoekers Lisa Klaassen en Ralph Schroeder, beschrijf ik hoe het toeschrijven van menselijke eigenschappen en zelfstandige intenties aan AI-systemen de rol van ontwikkelaars, bedrijven en gebruikers uit beeld kan laten verdwijnen. Mijn pleidooi is daarom om ook aandacht te blijven besteden aan de menselijke keuzes, belangen en machtsverhoudingen achter deze systemen.
Maak duidelijk wat AI-systemen aantoonbaar doen, welke interpretaties daaraan worden verbonden en wat nog onbekend is. Gebruik begrippen als bewustzijn, welzijn en intentie zorgvuldig en onderbouw uitspraken daarover met controleerbaar onderzoek. Maak daarnaast zichtbaar wie de systemen ontwikkelt, de doelen bepaalt, de regels vaststelt en verantwoordelijk is voor de gevolgen. Zo blijft ruimte voor onderzoek naar mogelijk AI-bewustzijn, zonder speculatie als feit te presenteren of de menselijke verantwoordelijkheid uit het oog te verliezen.