= Hvad ved vi om...

Hvad ved vi om sprogmodellers blindhed for bogstaver?

En ny metode har fået en stor sprogmodel til at tælle bogstaver korrekt — men hvad afslører det egentlig om, hvad nutidens AI-systemer grundlæggende ikke kan?

Konklusion først

Store sprogmodeller som ChatGPT og GPT-4 fejler konsekvent på opgaver, der for et barn ville være trivielle: tæl antallet af r'er i "strawberry", eller tæl i'erne i "artificial intelligence". Det er ikke et tilfældigt fejltrin — det er en strukturel svaghed indbygget i den måde, modellerne er bygget op på. En ny metode, publiceret i Nature, har løst problemet ved at "retrofitte" (eftermontere) en eksisterende model med en særlig komponent til tegnhåndtering. Det virker. Men løsningen afslører samtidig, hvor snævert problemet er defineret, og rejser større spørgsmål om, hvad sprogmodeller egentlig forstår.


Det politiske spørgsmål

Sprogmodeller er i hastig udbredelse i den offentlige sektor, i uddannelsessystemet og i erhvervslivet. Regeringen og Folketinget diskuterer løbende, hvordan AI bedst reguleres og implementeres. Men en forudsætning for en saglig debat er, at vi ved, hvad disse systemer faktisk kan og ikke kan — ikke hvad de ser ud til at kunne i en imponerende demonstration.

Bogstavtælling er et lille, konkret eksempel. Men det peger på et større spørgsmål: Når en sprogmodel fejler på en opgave, et barn på syv år løser uden besvær, hvad siger det så om, i hvilke sammenhænge vi med rimelighed kan stole på den?


Det empiriske spørgsmål bag

Spørgsmålet er ikke, om sprogmodeller er intelligente. Det er et filosofisk og definitionsmæssigt spørgsmål. Det empiriske spørgsmål er mere præcist: Hvilke typer opgaver fejler store sprogmodeller systematisk på, og skyldes det tilfældige mangler i træningsdata — eller er der tale om en grundlæggende arkitektonisk begrænsning, som ikke kan løses ved at træne mere?

Bogstavtælling er blevet et standardeksempel, netop fordi det er så enkelt at verificere. Enten er svaret rigtigt, eller det er forkert. Der er ingen fortolkning.


Hvad ved vi

Tokenisering er synderen ✓✓

Moderne sprogmodeller arbejder ikke med bogstaver. De arbejder med tokens — brudstykker af tekst, der typisk svarer til dele af ord, hele ord eller korte ordsekvenser. Ordet "strawberry" bliver for eksempel ikke repræsenteret som otte separate bogstaver, men som to eller tre tokens, afhængigt af den konkrete model.

Det betyder, at modellen aldrig "ser" de individuelle bogstaver, når den behandler tekst. Den har ingen direkte adgang til tegnenes identitet — kun til de komprimerede, statistiske repræsentationer af hele tokens. Forskning publiceret i 2025 bekræfter dette: sprogmodellers vanskeligheder med tegnbaserede opgaver som bogstavtælling og bogstavlokalisering skyldes fundamentalt den måde, tokenisering fungerer på — ikke manglende træning eller for lille en model.

Det er veletableret, at dette ikke er et spørgsmål om modelstørrelse. Selv meget store modeller med mange milliarder parametre fejler på disse opgaver, og fejlraten falder ikke markant, når modellerne skaleres op.

Fejlen er systematisk, ikke tilfældig ✓✓

En analyse af sprogmodellers fejlmønstre ved hjælp af en formel beregningsmodel viser, at fejl på tegnbaserede opgaver ikke er tilfældige. De følger et mønster, der kan forudsiges ud fra arkitekturen. Transformerarkitekturen — den tekniske fundament under stort set alle nutidens store sprogmodeller — mangler den type sekventiel, trin-for-trin-behandling, der er nødvendig for at tælle og lokalisere elementer i en streng af tegn. Rekurrente netværk (en ældre arkitekturtype) havde denne egenskab; transformere har den ikke som standard.

En benchmarkundersøgelse fra 2025, CharBench, der specifikt evaluerede modellers evne til tegnbaseret ræsonnement, dokumenterede systematiske fejl på tværs af mange modeller og opgavetyper — og pegede direkte på tokenisering som den fælles forklaringsfaktor.

Den nye løsning: retrofitting ✓

Den metode, der er beskrevet i Nature News, går ud på at eftermontere en eksisterende sprogmodel med en specialkomponent, der håndterer tegnrepræsentation separat fra den normale tokeniseringsproces. Modellen får dermed adgang til information om de individuelle bogstaver, den normalt ikke ser.

Resultatet er, at modellen nu kan tælle bogstaver korrekt — herunder tælle i'erne i "artificial intelligence", som giver anledning til overskriften. Det er et verificerbart resultat og et reelt teknisk fremskridt.

Tælleproblemer er et bredere fænomen ✓

Forskning fra 2024 viser, at sprogmodellers vanskeligheder med tælling ikke begrænser sig til bogstaver. Transformerarkitekturens manglende rekurrens (evnen til at holde styr på en løbende optælling gennem en sekvens) giver anledning til fejl i mange typer tælleopgaver. Modellerne kan lære at håndtere enkle tilfælde via mønstre fra træningsdata, men fejler på opgaver, der kræver præcis sekventiel optælling, særligt ved længere sekvenser eller usædvanlige eksempler.


Hvad ved vi ikke

Om retrofitting generaliserer. Den nye metode løser bogstavtælling. Men det er uklart, om den samme tilgang kan løse beslægtede problemer — for eksempel tegnbaseret stavning, anagrammer eller andre opgaver, der kræver tegnbevidsthed. Det er heller ikke dokumenteret, om tilføjelsen af tegnkomponenten forringer modellens præstation på andre opgaver.

Om det er den rigtige løsning. Retrofitting er i sagens natur en lappeløsning — man lapper en strukturel svaghed i stedet for at bygge en arkitektur, der ikke har svagheden. Det er muligt, at fremtidige arkitekturer håndterer tegnniveau og tokenniveau integreret fra starten. Det er også muligt, at tokenisering vedbliver at være standarden, og at retrofitting bliver den foretrukne tilgang. Det ved vi ikke endnu.

Hvad fejlen betyder for tillid i andre sammenhænge. Bogstavtælling er et isoleret eksempel. Men det åbner for spørgsmålet, om der eksisterer andre, mindre synlige strukturelle svagheder, som endnu ikke er blevet afdækket med enkle tests. Sprogmodeller præsenterer svar med samme sproglige selvtillid, uanset om de er rigtige eller forkerte — det gør det svært at vide, hvornår man kan stole på dem.


Hvad eksperter er uenige om

Er tokenisering et grundlæggende problem eller en praktisk detalje? ~

Nogle forskere argumenterer for, at tokenisering er et implementeringsvalg, ikke en fundamental begrænsning. Man kunne i princippet tokenisere på tegniveau — behandle hvert enkelt bogstav som sin egen enhed. Det ville potentielt løse bogstavtællingproblemet, men det ville også gøre modellerne langt mere beregningstunge og sandsynligvis forringe deres sproglige kompetencer på andre områder. Andre forskere ser tokeniseringen som så dybt integreret i nuværende arkitekturer, at det ikke er muligt at ændre den uden at bygge forfra.

Hvad siger fejlen om "forståelse"? ~

Her er uenigheden størst og mest principiel. Én position er, at en model, der fejler på bogstavtælling, åbenlyst ikke "forstår" sprog på samme måde som mennesker — og at det bør dæmpe forventningerne til, hvad modellerne kan bruges til. En modsat position er, at bogstavtælling er et perifert og teknisk trivielt eksempel, der siger meget lidt om modellernes evne til at løse de opgaver, de faktisk bruges til: tekstsammenfatning, oversættelse, kodegenerering og spørgsmålsbesvarelse.

Begge positioner har et empirisk fundament. Det er et reelt åbent spørgsmål, i hvilken udstrækning specifikke arkitektoniske svagheder smitter af på praktisk anvendelse.

Er skalering løsningen? ~

En udbredt antagelse i feltet har været, at mange af nutidens begrænsninger forsvinder, når modellerne bliver større og trænes på mere data. For bogstavtælling ser denne antagelse ikke ud til at holde — større modeller fejler stadig. Det antyder, at visse begrænsninger er arkitektoniske og ikke kan skaleres væk. Men hvor bred denne konklusion er — om den gælder for mange andre typer fejl eller kun for tegnbaserede opgaver — er der ikke enighed om.


Konklusion

Store sprogmodellers manglende evne til at tælle bogstaver er ikke en kuriositet eller en vittighed. Det er et veldokumenteret, reproducerbart eksempel på en strukturel begrænsning i den dominerende AI-arkitektur: fordi modellerne arbejder med tokens og ikke tegn, har de simpelthen ikke adgang til den information, der kræves for at løse opgaven.

Den nye retrofitting-metode, der er beskrevet i Nature, løser dette konkrete problem — og det er et reelt teknisk fremskridt. Men løsningen understreger snarere end modsiger det grundlæggende punkt: det krævede en specialiseret tilføjelse at løse en opgave, som menneskelig sprogforståelse håndterer uden videre.

Det bør informere den offentlige debat om AI. Ikke til at konkludere, at sprogmodeller er ubrugelige — det er de ikke. Men til at fastholde, at de har reelle, identificerbare, arkitektonisk betingede svagheder, som ikke forsvinder af sig selv, og som vi ikke altid kan se, når modellen præsenterer et flydende og overbevisende svar.

Saglig tillid til AI-systemer kræver præcis viden om, hvad de kan og hvad de ikke kan. Her giver bogstavtælling et usædvanligt klart svar.


Kilder