= Hvad ved vi om...

Hvad ved vi om AI's evne til at sige nej til skadelige anmodninger?

Forskning viser systematiske svagheder i AI-modellers evne til at afvise skadelige prompter, men der findes ingen standardiseret metode til at teste hvor pålidelig denne evne reelt er.

Det politiske spørgsmål

Når politikere og regulatorer taler om sikker AI, hviler en stor del af tilliden på én grundlæggende antagelse: at AI-systemer kan lære at sige nej. At en sprogmodel, der bruges i et hospital, en offentlig myndighed eller en skole, selv kan genkende og afvise farlige eller skadelige anmodninger.

EU's AI-forordning bygger delvist på denne antagelse. Forordningen stiller krav om, at høj-risiko AI-systemer er robuste og sikre, og den forbyder en række former for AI-praksis, der udgør en klar trussel mod sundhed, sikkerhed og grundlæggende rettigheder. I Danmark fører Digitaliseringsstyrelsen tilsyn med forordningens efterlevelse.

Men hvad nu hvis antagelsen ikke holder? Hvad hvis AI-modellers evne til at afvise skadelige anmodninger er langt mere skrøbelig end antaget — og vi ikke engang har de rigtige redskaber til at måle det?

Det er præcist det spørgsmål, en voksende krop af forskning begynder at stille.


Det empiriske spørgsmål bag

Teknisk kaldes det "refusal" (afvisning): en AI-models evne til at genkende en skadelig eller uønsket anmodning og nægte at efterkomme den. Det lyder enkelt. Det er det ikke.

For det første skal modellen lære at skelne mellem en anmodning, der er skadelig, og en der blot ligner. Det kræver nuanceret forståelse af kontekst, hensigt og domæne. For det andet skal modellen modstå forsøg på at snyde den — såkaldte "jailbreaks" (svinkeærinder), hvor brugere manipulerer modellen til at omgå dens egne sikkerhedsregler.

Det centrale empiriske spørgsmål er: Hvor robust er denne evne i praksis, og hvordan måler vi den pålideligt?


Hvad ved vi

Jailbreaks virker — og de bliver mere sofistikerede ✓✓

Forskning viser konsekvent, at AI-modellers afvisningsmekanismer kan omgås. En metode, der har fået særlig opmærksomhed, kaldes "H-CoT" — Hijacking the Chain-of-Thought (kapring af tankerækken). Idéen er, at nyere AI-modeller som OpenAI's o1/o3, DeepSeek-R1 og Gemini 2.0 Flash Thinking bruger synlig tænkning — de "tænker højt", inden de svarer — delvist for at vurdere om en anmodning er sikker.

Forskning fra 2025 viser, at denne sikkerhedsmekanisme selv kan kapres. Ved at manipulere den synlige tankeproces kan angribere få modellen til at nå en forkert sikkerhedsvurdering og derefter levere det skadelige indhold. Modeller, der altså bruger avanceret ræsonnering som sikkerhedsfilter, er ikke nødvendigvis mere robuste — snarere tværtimod, fordi angrebet nu har et nyt indgangspunkt.

Medicinsk AI er særligt sårbar ✓✓

En stor evaluering fra 2025, kaldet CARES (Comprehensive Evaluation of Safety and Adversarial Robustness), undersøgte AI-modeller, der er specialiseret til medicinske sammenhænge. Resultaterne er bekymrende: modellerne er i vid udstrækning sårbare over for "adversarial manipulation" (fjendtlig manipulation) — altså forsøg på at narre dem til at afgive skadelige medicinske råd eller omgå etiske retningslinjer.

Studiet understreger, at sikkerhed og alignment (tilpasning til menneskelige værdier) ikke kan tages for givet, blot fordi en model er trænet på medicinske data. Faglig specialisering beskytter ikke automatisk mod manipulationsforsøg.

Modelfusion skaber nye sikkerhedshuller ✓

En af de nyeste metoder til at give AI-modeller nye kompetencer hedder "model merging" (modelsammensmeltning): man kombinerer en sikkerhedsgodkendt grundmodel med specialiserede moduler — for eksempel et matematikmodul eller et kodningsmodul — uden at omtræne hele modellen fra bunden. Det sparer ressourcer og er ved at blive standardpraksis i industrien.

Forskning fra 2026 viser, at denne tilgang kan undergrave de sikkerhedsegenskaber, grundmodellen er blevet trænet til at have. Når specialiserede "task vectors" (opgavevektorer) foldes ind i modellen, kan de utilsigtet svække afvisningsevnen — og jo mere specialiseret tilføjelsen er, desto større er risikoen. Sikkerheden i den endelige model kan altså ikke forudsiges ud fra sikkerheden i de enkeltdele, man sammensætter den af.

Robusthed varierer med brugssituation ✓

En anden undersøgelse fra 2026 påpeger en metodologisk fejl i, hvordan jailbreak-robusthed typisk måles: de fleste evalueringer tester modellen i én standardkonfiguration. Men i virkeligheden interagerer brugere med modeller under vidt forskellige betingelser — med forskellige systeminstruktioner, forskellige samtalekontekster og forskellige brugerindstillinger.

Studiet viser, at en models robusthed kan variere markant afhængigt af disse "driftsforhold". En model, der klarer sig godt i en standardtest, kan være langt mere sårbar i en reel brugssituation. Det betyder, at eksisterende sikkerhedsevalueringer systematisk kan overvurdere den faktiske robusthed.


Hvad ved vi ikke

Der er ingen standardiseret, uafhængig metode til at teste AI-modellers afvisningsevne på tværs af modeller, udbydere og anvendelsesområder. Det gør det svært at sammenligne resultater og endnu sværere at regulere på et oplyst grundlag.

Vi ved ikke, om de jailbreak-metoder, forskere tester i kontrollerede forsøg, svarer til dem, der faktisk bruges i praksis af ondsindede aktører. Der kan eksistere angrebsmetoder, som endnu ikke er dokumenteret i den åbne litteratur.

Vi ved heller ikke, om forbedret afvisningsevne i én dimension — for eksempel mod kendte jailbreak-teknikker — reducerer robustheden i en anden. Der er tegn på, at sikkerhed og brugbarhed kan stå i et spændingsforhold: en model, der afviser for meget, er ubrugelig; en der afviser for lidt, er farlig.

Endelig er der ingen offentligt tilgængeligt, systematisk overblik over, hvilke AI-systemer der aktuelt er sat i drift i Danmark, og hvilke sikkerhedsevalueringer de har gennemgået inden ibrugtagning.


Hvad eksperter er uenige om

Er transparens et sikkerhedsredskab eller en sårbarhed? ~

Nyere AI-modeller viser deres tankeproces synligt. Idéen er, at gennemsigtighed giver brugeren mulighed for at kontrollere ræsonnementet. Men forskning i H-CoT-angreb antyder, at synlig tankegang også giver angribere et nyt angrebsoverflade. Eksperter er uenige om, hvorvidt transparens netto gavner eller skader sikkerheden.

Kan sikkerhed standardiseres? ~

Nogle forskere og regulatorer mener, at man kan og bør opstille fælles, målbare sikkerhedskrav til afvisningsevne — på samme måde som man tester bilsikkerhed med standardiserede kollisionsforsøg. Andre mener, at AI-sikkerhed er for kontekstafhængig og dynamisk til at lade sig indfange i faste benchmarks, og at enhver standardtest vil hinke bagefter de angrebsmetoder, der udvikles løbende.

Hvem bærer ansvaret? ⚖

Hvis en AI-model bruges i en dansk offentlig institution og afviser en legitim anmodning — eller omvendt: efterkommer en skadelig en — hvem er da ansvarlig? Modeludbyderen, den offentlige myndighed der har sat systemet i drift, eller brugeren? EU's AI-forordning forsøger at fordele dette ansvar, men de praktiske grænselinjer er stadig uklare.


Konklusion

Det centrale problem er ikke, at AI-modeller ikke kan lære at sige nej. Det kan de — til en vis grad. Problemet er, at vi systematisk overvurderer pålideligheden af denne evne, og at de metoder, vi bruger til at teste den, ikke afspejler de vilkår, modellerne møder i den virkelige verden.

Forskning dokumenterer tre overlappende sårbarheder: kendte angrebsmetoder som jailbreaks virker, selv på de mest avancerede modeller; ny praksis som modelsammensmeltning kan utilsigtet nedbryde sikkerhedsegenskaber; og standardiserede tests undervurderer sårbarhed, fordi de ikke tager højde for den faktiske variation i brugssituationer.

EU's AI-forordning stiller krav om robusthed i høj-risiko AI-systemer, men kravene er kun meningsfulde, hvis der eksisterer troværdige metoder til at måle robusthed. Det gør der i dag ikke — i hvert fald ikke på en standardiseret og uafhængig måde.

For dansk AI-politik og -tilsyn peger det i retning af to konkrete behov: for det første uafhængig og metodisk stærk sikkerhedsevaluering af AI-systemer, inden de sættes i drift i kritiske sammenhænge som sundhed, undervisning og offentlig forvaltning; for det andet åbenhed om, hvilke systemer der er i brug, og hvilke evalueringer de har gennemgået.

Tilliden til at AI siger nej, når det gælder, er i dag større end evidensgrundlaget begrunder. Det er et problem — ikke primært for AI-industrien, men for de borgere og institutioner, der dagligt interagerer med disse systemer.


Kilder