Et nyt eksperiment tester empirisk, om en AI-model kan gennemføre logiske ræsonneringstrin uden at bruge sprog som mellemled — og hvad det betyder for vores forståelse af, hvordan sprogmodeller egentlig tænker.
Det politiske spørgsmål
Kunstig intelligens fylder stadig mere i den offentlige debat — om job, om sikkerhed, om hvem der kontrollerer teknologien. Men bag de store spørgsmål gemmer sig et mere grundlæggende problem: Vi ved faktisk ikke præcis, hvad der sker inde i en AI-model, når den "tænker".
Det har konsekvenser. Hvis vi ikke forstår, hvordan AI-systemer når frem til deres svar, er det svært at regulere dem fornuftigt, svært at stole på dem i kritiske situationer og svært at gøre dem billigere at drive. Energiforbruget ved at køre store sprogmodeller er massivt, og det er en politisk og klimamæssig udfordring i sig selv.
Et nyt forsøg med en lille, eksperimentel model kaldet "Dragon Hatchling" stiller spørgsmålet på en ny måde: Behøver en AI overhovedet at tænke i ord?
Det empiriske spørgsmål bag
Nutidens store sprogmodeller — som GPT-4, Claude og Gemini — er såkaldte transformermodeller (en type neuronet netværk, der behandler tekst som sekvenser af tokens, altså ordstykker). De er trænet på enorme mængder tekst og genererer svar ved at forudsige ét ord ad gangen.
Når disse modeller løser komplekse opgaver, bruger de ofte en teknik kaldet "chain-of-thought" (på dansk: tankekæde), hvor modellen skriver sine mellemregninger ud som ord, inden den giver det endelige svar. Det er lidt som at tænke højt på papir. Og det virker — modeller klarer sig markant bedre på svære opgaver, når de må "tænke skridt for skridt".
Men det er dyrt. Hvert ekstra ord koster beregningskraft og energi. Og det rejser et naturligt spørgsmål: Er sproget nødvendigt for selve ræsonneringen, eller er det bare en vane? Kan en model ræsonnere internt — uden at formulere hvert trin i ord?
Det er præcis det spørgsmål, forskerholdet bag Dragon Hatchling har forsøgt at besvare eksperimentelt.
Hvad ved vi
Dragon Hatchling: en anderledes arkitektur
Dragon Hatchling (forkortet BDH) er ikke en traditionel sprogmodel. Den er designet med inspiration fra, hvordan den biologiske hjerne fungerer — herunder brug af såkaldte spiking neurons (neuroner, der kommunikerer via diskrete "spikes" ligesom ægte nerveceller) og Hebbisk læring (en læringsform baseret på, at neuroner der aktiveres samtidig, styrker forbindelsen imellem sig).
Det centrale greb i BDH er, at modellens arbejdshukommelse under inferens — altså under selve ræsonneringsprocessen — udelukkende hviler på synaptisk plasticitet (hjernens evne til at justere forbindelsernes styrke) med Hebbisk læring via spiking neurons. Det er en radikal forskel fra transformermodeller, der bruger en mekanisme kaldet "attention" til at holde styr på kontekst.
~ Ifølge forskerne bag projektet bekræfter de empirisk, at specifikke, individuelle synapser i modellen ændrer sig under inferens — altså at modellen bogstaveligt talt "husker" og tilpasser sig, mens den løser en opgave, uden at skrive noget ned som tekst.
Ræsonnering uden sproglige mellemtrin
Det afgørende fund er, at BDH kan udføre logiske ræsonneringstrin internt — i det, man kan kalde et ikke-sprogligt mellemrum — uden at producere tekst for hvert skridt. Modellen behøver ikke at formulere "først gør jeg X, så gør jeg Y" som læsbare ord. Ræsonneringen foregår i stedet som ændringer i de synaptiske forbindelsers styrke.
✓ Dette er en empirisk demonstration — ikke blot en teoretisk påstand. Forskerne har bygget og testet modellen og dokumenteret adfærden i en publiceret artikel på arXiv.
Hvis dette holder, peger det på, at sproget måske ikke er selve tænkningens medium — men snarere ét muligt output-format. Ræsonnering og sprog kan være adskilte processer.
Potentielle fordele: effektivitet og fortolkelighed
Traditionelle tankekæde-metoder kræver, at modellen producerer mange ekstra tokens (ordstykker) — og hvert token koster. En model der kan ræsonnere internt uden at generere tekst undervejs, vil potentielt kunne nå de samme svar med markant færre beregninger.
✓ Det er et konkret argument for, at denne type arkitektur kan være mere effektiv end nutidens store sprogmodeller til visse opgavetyper.
Der er desuden en fortolkeligheds-dimension (på engelsk: interpretability). Når en model skriver sine mellemregninger ud som tekst, kan vi i princippet læse dem — men vi ved ikke, om det er det, der faktisk sker internt. Med BDH's arkitektur er de interne tilstande — ændringerne i synapserne — direkte målbare. Det giver en anden slags indsigt i, hvad der foregår.
Hvad ved vi ikke
Der er mange åbne spørgsmål, og det er vigtigt at holde sig dem for øje.
Skalerbarhed: BDH er en lille, eksperimentel model. Vi ved ikke, om tilgangen kan skaleres til de størrelser og opgavemængder, som kommercielle sprogmodeller håndterer. Resultater fra små modeller kan ikke automatisk overføres til store systemer.
Opgavebredde: Det er uklart, om ordløs intern ræsonnering fungerer på tværs af alle typer opgaver, eller om det er begrænset til bestemte logiske strukturer. Kompleks naturlig sprogforståelse, nuanceret argumentation og kreativ tænkning stiller andre krav end ren symbollogik.
Sammenlignelighed: Det er metodisk svært at sammenligne BDH direkte med traditionelle transformermodeller, fordi arkitekturerne er så fundamentalt forskellige. En demonstration af, at BDH kan ræsonnere uden ord, siger ikke nødvendigvis noget om, hvad der sker inde i GPT-4, når den bruger tankekæder.
Hjernelighed: Forskerholdet trækker på inspiration fra neurovidenskab — men biologiske hjerner og kunstige neurale netværk er stadig meget forskellige systemer. At noget ligner hjernens mekanismer betyder ikke, at det fungerer på samme måde eller er ligeså effektivt.
Reproducerbarhed: Artiklen er publiceret som et preprint på arXiv, hvilket betyder, at den endnu ikke har gennemgået fuld fagfællebedømmelse (peer review). Resultaterne er dermed foreløbige og bør behandles med forbehold, indtil de er bekræftet af uafhængige forskere.
Hvad eksperter er uenige om
~ Spørgsmålet om, hvad ræsonnering egentlig er i sprogmodeller, er dybt omstridt i AI-forskningsmiljøet.
Én position er, at store sprogmodellers tankekæder faktisk afspejler en meningsfuld intern ræsonneringsproces — at modellen genuint "tænker igennem" problemet, og at sproget er tæt sammenvævet med denne proces. Fra dette synspunkt er det problematisk at "fjerne" sproget fra ræsonneringen.
En anden position er, at tankekæder primært er et overfladefænomen — at modellen producerer plausibelt lydende mellemregninger, fordi den er trænet på tekst skrevet af mennesker der tænker højt, men at den interne repræsentation ikke nødvendigvis svarer til de ord, der skrives ud. Fra dette synspunkt er BDH's tilgang ikke bare mulig, men potentielt mere ærlig om, hvad der egentlig sker.
~ En tredje position sætter spørgsmålstegn ved, om ordene "ræsonnering" og "tænkning" overhovedet er meningsfulde at bruge om nutidens AI-systemer — uanset arkitektur. Disse systemer matcher mønstre og optimerer sandsynligheder; om det konstituerer ægte ræsonnering, er et filosofisk spørgsmål, som forskningen endnu ikke har besvaret.
⚖ Og så er der værdispørgsmålet om fortolkelighed: Selv hvis BDH's interne tilstande er direkte målbare, er det ikke givet, at de er lettere at forstå for mennesker. Synaptiske styrkeændringer i et kunstigt neuralt netværk er ikke nødvendigvis mere gennemsigtige end tekstbaserede tankekæder — de er bare anderledes.
Konklusion
Nøglepunkter:
- En ny, eksperimentel AI-model kaldet Dragon Hatchling demonstrerer empirisk, at det er muligt at udføre logiske ræsonneringstrin internt — uden at formulere hvert trin som sprog.
- Modellen bruger biologisk inspirerede mekanismer, herunder spiking neurons og Hebbisk læring, og dens arbejdshukommelse under ræsonnering hviler udelukkende på målbare ændringer i synaptiske forbindelser.
- Hvis tilgangen kan skaleres, peger det på en mulig vej mod markant mere effektive AI-systemer — med lavere beregningsomkostninger og potentielt bedre fortolkelighed.
- Men modellen er lille, artiklen er ikke peer-reviewet, og mange grundlæggende spørgsmål om skalerbarhed og opgavebredde er ubesvarede.
- Eksperimentet udfordrer en central antagelse i nutidens AI-forskning: at sproget er uadskilleligt fra ræsonnering i store sprogmodeller. Den antagelse er nu empirisk anfægtet — om end langt fra afvist.
Det, Dragon Hatchling viser os, er ikke at AI har lært at tænke som mennesker — eller at ord er overflødige. Det viser, at vi måske har haft en blind vinkel: Vi har bygget systemer der tænker højt, og derefter antaget, at tænkning kræver at tænke højt. Det er en antagelse, det nu er værd at undersøge kritisk.