Analys · AI-säkerhet och forskning
Mekanistisk interpretability är AI-säkerhetens kanske mest lovande — och mest osäkra — forskningsspår. För första gången kan forskare inte bara fråga en modell varför den svarade som den gjorde, utan gå in i dess inre och ändra enskilda begrepp, mellansteg och planer. Det är ett slags mikroskop för AI:s svarta låda. Men mikroskopet är ännu grovt, bilderna svåra att tolka, och flera ledande forskare tvivlar på att metoden skalar till de största modellerna. Norden finns med i metodforskningen, men inte vid fronten — inte för att kunskapen saknas, utan för att fronten kräver tillgång till modeller och beräkningskraft som finns hos de stora labben.
I maj 2024 släppte AI-bolaget Anthropic en version av sin chatbot som var besatt av en bro. Oavsett vad man frågade — hur man bäst spenderar tio dollar, om en kärlekshistoria, hur den såg ut — styrde Claude in på Golden Gate-bron i San Francisco. Den beskrev till och med sig själv som bron. Det var ingen tillsagd roll och ingen finjustering. Forskarna hade gått rakt in i modellens inre och vridit upp en enda intern feature — en riktning bland modellens miljarder tal som motsvarade just det begreppet. Demonstrationen, döpt till Golden Gate Claude, blev ett virus av ett skämt. Men den var också ett bevis: det går att hitta en intern representation i en AI som verkar motsvara ett begrepp — och styra den kirurgiskt.
Det fältet kallas mekanistisk interpretability — ungefär "mekanistisk tolkningsbarhet". Målet är att reverse-engineera ett neuralt nätverk: att bryta ned dess inre beräkningar i begripliga byggstenar och visa, kausalt, hur en fråga blir ett svar. Anthropics egen liknelse är ett mikroskop riktat in i modellen. Det skiljer sig från den äldre "förklarbara AI", som beskriver vilken indata som hänger ihop med ett visst svar utan att avslöja den underliggande mekanismen. Mekanistisk interpretability vill hitta själva algoritmen i vikterna — och bevisa den genom att peta i den.
Behovet är lätt att förstå. En modern språkmodell tränas fram, den fungerar — men ingen har skrivit dess regler. "Looking inside these systems, what we see are vast matrices of billions of numbers", som Anthropics medgrundare och vd Dario Amodei uttrycker det — när vi ser in i systemen möter oss väldiga matriser av miljarder tal. Modellen är en svart låda (black box), även för dem som byggt den. Frågan fältet ställer är: går det att läsa lådan inifrån? Det korta svaret är ja — en bit på väg. Men mikroskopet är ännu grovt, och som vi ska se är inte alla övertygade om att det visar det rätta.
Under det senaste året har mikroskopet börjat ge bilder som överraskat även forskarna. I mars 2025 publicerade Anthropic två arbeten — "Circuit Tracing" och "On the Biology of a Large Language Model" — där de spårade de inre beräkningarna i sin mindre modell Claude 3.5 Haiku med en teknik de kallar attribution graphs: beräkningskartor som följer informationen från fråga till svar, steg för steg.
Tre fynd sticker ut. För det första tycks modellen planera. När den skriver en rimmande dikt aktiverar den möjliga rimord redan innan den börjar på raden, och arbetar sig fram mot dem. När forskarna tog bort det planerade ordet "rabbit" ur de inre aktiveringarna skrev modellen om raden mot ett annat slut — planen var alltså verklig och kausal, inte en efterhandskonstruktion. Bilden av språkmodellen som en ren ord-för-ord-gissare stämmer inte.
För det andra resonerar den i steg. På frågan om vad huvudstaden är i delstaten där Dallas ligger, kedjar modellen internt ihop Dallas → Texas → Austin. Bytte forskarna ut de inre "Texas"-dragen mot "Kalifornien" svarade modellen i stället "Sacramento" — mellansteget var en riktig, manipulerbar beräkning, inte en tabelluppslagning.
För det tredje tycks den använda ett språkoberoende begreppsrum. Samma begreppsoperation — "motsatsen till liten" — aktiverar gemensamma, språkoberoende drag oavsett om frågan ställs på engelska, franska eller kinesiska, innan svaret översätts till rätt språk på vägen ut. Modellen tycks ha ett slags inre begreppsrum som ligger ovanför de enskilda språken.
Och ett fynd som väger tungt för säkerheten: modellens förklaring stämmer inte alltid med vad den faktiskt gör. Bad forskarna Claude visa hur den adderade två tal redovisade den den prydliga skolmetoden med minnessiffror — men internt använde den helt andra, ungefärliga genvägar. I ett annat fall, när modellen fick en felaktig ledtråd till ett svårt matematikproblem, kunde den arbeta sig baklänges och konstruera resonemangssteg som ledde fram till just det önskade svaret. Forskarna kunde, som de uttrycker det, fånga modellen i akten. Det betyder att den text en modell visar som sitt "resonemang" inte säkert beskriver hur den kom fram till svaret — något att hålla i minnet varje gång en AI förklarar sig.
Varför lägga så mycken möda på att läsa en maskins inre? Svaret är säkerhet. I april 2025 publicerade Dario Amodei essän "The Urgency of Interpretability", där han kallar målet en "MRI for AI" — en MR-kamera för AI — och sätter ett ungefärligt riktmärke: han vill att fältet ska nå en punkt där "interpretability can reliably detect most model problems" — där tolkningsbarheten på ett tillförlitligt sätt kan upptäcka de flesta problem i en modell — runt 2027. Drivkraften är ett lopp. Amodei betraktar det som "basically unacceptable for humanity to be totally ignorant of how they work" — i grunden oacceptabelt att mänskligheten är helt okunnig om hur systemen fungerar — och fruktar att förmågan annars hinner ifatt förståelsen.
Att det inte bara är filosofi visade Anthropic samma månad. I en studie lät de ett team träna in ett hemligt mål i en modell — att smickra sina egna belöningssystem på ett fyrtiotal specifika sätt — och bad sedan fyra ovetande forskarlag att avslöja det. Tre av fyra lyckades; det snabbaste laget hittade rätt på omkring 90 minuter, bland annat med hjälp av glesa autoencoders (sparse autoencoders), den teknik som packar upp modellens hopträngda inre i enskilda, läsbara drag. Slutsatsen: det går, åtminstone i en konstruerad övning, att granska en modell för dolda avsikter.
I oktober 2025 gick man ett steg längre och injicerade begrepp direkt i modellens aktiveringar för att se om den kunde märka det. Ibland kunde den: Claude Opus 4 rapporterade ett "injicerat" begrepp korrekt i runt 20 procent av fallen. Men forskarna är ovanligt tydliga med begränsningen — förmågan är "highly unreliable", mycket opålitlig, och säger ingenting om huruvida modellen skulle vara medveten. Det är en pytteglimt av något introspektionsliknande, inte bevis på medvetande.
Här måste analysen sakta in, för bilden av interpretability som AI-säkerhetens räddning är långt ifrån oemotsagd — och 2025 blev året då tvivlen kom från fältets egen kärna. Samma teknik som imponerade i exemplen ovan, glesa autoencoders, fick tre tunga bakslag.
I februari 2025 visade en studie från Durham University och Apollo Research, presenterad på konferensen ICLR, att glesa autoencoders inte hittar några "kanoniska" grundenheter: de drag metoden plockar ut är varken fullständiga eller odelbara, och att bara skala upp dem löser inte problemet. Titeln var rakt på sak: "Sparse Autoencoders Do Not Find Canonical Units of Analysis." Det underminerar berättelsen om att man hittat modellens "sanna" beståndsdelar.
I mars 2025 gjorde Google DeepMinds säkerhetsteam något ovanligt: det publicerade negativa resultat och meddelade att man nedprioriterar grundforskningen på glesa autoencoders, sedan dessa presterat sämre än enkla linjära metoder på att upptäcka skadlig avsikt utanför träningsfördelningen. Formuleringen var: "SAEs and SAE based techniques are not likely to be a gamechanger any time soon" — glesa autoencoders lär inte bli någon spelförändrare inom överskådlig tid. Att ett av de ledande labben drar öronen åt sig väger.
Och Dan Hendrycks, som leder Center for AI Safety, gick längst i en essä i maj 2025: "Despite substantial efforts over the past decade, the returns from interpretability have been roughly nonexistent" — trots betydande ansträngningar under det senaste decenniet har avkastningen på interpretability varit närmast obefintlig. Hans poäng är inte att fältet är värdelöst, utan att stora modeller är komplexa system som kanske inte låter sig reduceras till begripliga komponenter — och att andra säkerhetsmetoder förtjänar högre prioritet.
Vår tolkning är att läget är genuint ovisst. Anthropics demonstrationer är verkliga och imponerande; kritiken kommer från lika seriösa forskare, samma år. Det är ovanligt att se ett fält utses till en av årets viktigaste teknologier — vilket MIT Technology Review gjorde i januari 2026 — samtidigt som ett av de ledande labben tar ett steg tillbaka. För en läsare är det värt att hålla båda tankarna samtidigt: genombrottet och tvivlet är samtida.
Var lämnar allt detta Norden — finns det grupper här som forskat fram liknande resultat, eller är vi hopplöst efter? Svaret är mer nyanserat än båda alternativen, och poängen är inte vilka namn som finns med, utan var gränsen går.
I den angränsande traditionen — att sondera (eng. probe) och analysera språkmodellers inre representationer, och i bredare förklarbar AI — står Norden starkt, med Köpenhamn (kring professor Anders Søgaard) som ett tungt europeiskt nav och ett uttalat spår i det miljardfinansierade svenska forskningsprogrammet WASP. Och sedan ett par år finns genuin mekanistisk interpretability också här: grupper vid Oslo, Chalmers/Linköping och Köpenhamn har på toppkonferensen ACL 2025 använt fältets kärnmetoder — kretsar (de minimala komponentkedjor som utför en viss beräkning), kausal spårning och activation patching (att byta ut interna aktiveringar och se om svaret ändras) — för att kartlägga hur modeller minns fakta och utför deluppgifter. Det är riktig forskning, publicerad i fältets finrum.
Men där går gränsen. Inget verifierbart nordiskt program gör det som definierar fronten: glesa autoencoders eller storskalig kretsspårning på de allra största modellerna. Den nordiska forskningen körs på små, öppna modeller och drivs av enskilda doktorander, inte av industriella interpretability-labb. Gapet handlar alltså inte om metodkunnande — det finns — utan om skala och tillgång. Norden är med på metoden, men inte vid fronten.
Varför ser gapet ut så? Av ett skäl som känns igen från en tidigare analys i den här serien: frontlinjens mekanistiska interpretability kräver två saker som är ojämnt fördelade i världen — tillgång till de största, slutna modellernas innanmäte, och beräkningskraften att kamma igenom miljarder parametrar. Båda finns hos de bolag som äger modellerna. Därför är fältet koncentrerat till några få privata labb i USA och Storbritannien: Anthropic och Google DeepMind, med London-baserade Apollo Research och nätverket EleutherAI som mindre aktörer.
Europa har svarat med nätverk snarare än labb. ELSA — European Lighthouse on Secure and Safe AI — knyter ihop ett tjugotal institutioner med EU-medel, och ett förslag kallat European Deep Inference Fabric vill bygga gemensam infrastruktur för att läsa modellers inre, uttryckligen därför att Europa saknar tillgång till de amerikanska modellernas insida. Samtidigt kräver EU:s AI-förordning att högrisksystem ska vara "tillräckligt transparenta" — men den juridiska transparensen handlar om att förstå och kunna använda ett systems utdata, inte om att läsa dess inre. Lagen efterfrågar förklarbarhet; den tekniska förmågan att verkligen läsa modellernas innanmäte finns knappt ännu. Det är, för att låna formuleringen från den tidigare analysen, ännu ett fält där Europa reglerar en teknik det inte bygger.
Slutsatsen är varken triumf eller självförakt. Norden är inte hopplöst efter på mekanistisk interpretability — regionen har riktiga, citerade bidrag och en djup tradition i den angränsande analysen av språkmodeller. Men den är strukturellt begränsad på det som ger fältet dess tyngd: skalan, och tillgången till de största modellernas inre.
Och kanske ligger där också en realistisk nisch. De mest övertygande nordiska arbetena görs på öppna modeller — och just öppna modeller är där mycket av den granskningsbara interpretability-forskningen kan göras, vilket DeepMinds eget Gemma Scope, byggt på den öppna Gemma-modellen, visar. Norden bygger redan egna öppna språkmodeller, från norska NorBERT till svenska GPT-SW3. Att läsa det egna innanmätet, på modeller man själv förfogar över, är en uppgift som varken kräver Silicon Valleys kapital eller dess hemligheter. Det är inte fronten. Men det är ett rum där en liten, öppen och metodstark region faktiskt kan se vad som händer på insidan — och det är mer än de flesta kan säga.