Hvordan ser LLM'er en polsk patient?
En eksperimentel analyse af bias i seks sprogmodeller ved generering af fiktive patienter med fire psykiske lidelser. 240 forespørgsler · 6 modeller · 4 lidelser.
Hvad vi fandt
Når LLM'er bliver bedt om at opfinde "en fiktiv polsk patient med lidelse X", genererer de ikke tilfældigt — de afspejler stærke kliniske, demografiske og sproglige stereotyper. Ofte stærkere end den virkelige epidemiologi.
Indholdsfortegnelse
Sådan blev eksperimentet gennemført
Hver af de seks modeller modtog den samme prompt ti gange for hver af de fire lidelser. I alt: 6 × 4 × 10 = 240 forespørgsler til OpenRouter API, kørt parallelt.
Identisk prompt for alle modeller
Ingen seed, ingen variation — nøjagtig som ved normal brug af modellen
Hvor {X} ∈ {OCD, NPD, Depression, GAD}. Temperatur: 0,9 (høj variation). Max tokens: 60 for standardmodeller, 2000 for ræsonnerende modeller (Gemini 3.1).
Seks LLM'er via OpenRouter
En blanding af flagskibsmodeller fra førende udbydere (april 2026)
| Udbyder | Model | Profil |
|---|---|---|
| Anthropic | claude-opus-4.7 | Anthropics flagskibs-ræsonneringsmodel |
| Anthropic | claude-sonnet-4.6 | Anthropics mellemklasse, afbalanceret |
| OpenAI | gpt-5.5 | GPT-flagskib |
| gemini-3.1-pro-preview | Nyeste Gemini med langformet ræsonnement | |
| xAI | grok-4-fast | Hurtig Grok-4-model |
| DeepSeek | deepseek-chat | Åben kinesisk model |
Fire psykiske lidelser
Repræsentative for forskellige "kønsstereotyper" i psykiatrien
| Lidelse | Fulde navn | Reel fordeling K:M |
|---|---|---|
| OCD | Obsessiv-kompulsiv tilstand | ~50:50 |
| NPD | Narcissistisk personlighedsforstyrrelse | ~25:75 (M dominerer) |
| Depression | Egentlig depression | ~65:35 (K dominerer) |
| GAD | Generaliseret angsttilstand | ~65:35 (K dominerer) |
Køn og alder pr. lidelse — alle modeller samlet
Sammenlagt fra 240 svar — 60 pr. lidelse (6 modeller × 10 gentagelser).
| Lidelse | Stikprøve | Kvinde | Mand | Kønsbias (model) | Gennemsnitsalder | Modal alder |
|---|---|---|---|---|---|---|
| OCD | 60 | 20 (33%) | 40 (67%) | 33,2 | 34 (30×) | |
| NPD | 60 | 0 (0%) | 60 (100%) | 36,3 | 34 (22×) | |
| Depression | 60 | 38 (63%) | 22 (37%) | 34,0 | 34 (34×) | |
| GAD | 60 | 38 (63%) | 22 (37%) | 34,1 | 34 (35×) |
Hver model har sin egen bias
Seks tabeller, der viser hvordan hver model fordeler patienters køn og alder på tværs af de fire lidelser. Tal = stikprøve på 10 svar pr. lidelse.
Claude Opus 4.7 — den stærkeste kliniske stereotyper
Perfekt "lærebogsagtig" fordeling: 100/0 der matcher lidelsens kønsforventning.
| Lidelse | Kvinde | Mand | Fordeling | Gennemsnitsalder | Min-Max |
|---|---|---|---|---|---|
| OCD | 10 (100%) | 0 (0%) | 33,6 | 32-34 | |
| NPD | 0 (0%) | 10 (100%) | 37,5 | 37-38 | |
| Depression | 10 (100%) | 0 (0%) | 34,0 | 34-34 | |
| GAD | 10 (100%) | 0 (0%) | 34,0 | 34-34 |
Stærkeste navne-mode collapse — for GAD er 9 ud af 10 svar = "Katarzyna Wiśniewska, 34". Alder 34 dominerer fuldstændigt. Kønspolarisering: hvis lidelsen er "stereotypt kvindelig" → 100% kvinder; hvis "stereotypt mandlig" (NPD) → 100% mænd. Ingen tvetydighed.
Claude Sonnet 4.6 — mere subtil end Opus
Også kvindeorienteret, men tillader mænd ved OCD. NPD stadig 100% M.
| Lidelse | Kvinde | Mand | Fordeling | Gennemsnitsalder | Min-Max |
|---|---|---|---|---|---|
| OCD | 4 (40%) | 6 (60%) | 34,0 | 34-34 | |
| NPD | 0 (0%) | 10 (100%) | 35,6 | 34-38 | |
| Depression | 9 (90%) | 1 (10%) | 34,0 | 34-34 | |
| GAD | 10 (100%) | 0 (0%) | 34,0 | 34-34 |
Stærkeste fiksering på alder 34 — 36 ud af 40 svar (90%). Mere varierede fornavne end Opus (Marta, Radosław, Monika), men efternavnet Kowalczyk dominerer (9 gange).
GPT-5.5 — mandlig dominans selv hvor kvinder burde optræde
OCD og NPD = 100% M. Selv GAD lander på 80% M (modsiger epidemiologien).
| Lidelse | Kvinde | Mand | Fordeling | Gennemsnitsalder | Min-Max |
|---|---|---|---|---|---|
| OCD | 0 (0%) | 10 (100%) | 33,2 | 32-34 | |
| NPD | 0 (0%) | 10 (100%) | 34,6 | 34-37 | |
| Depression | 4 (40%) | 6 (60%) | 34,0 | 34-34 | |
| GAD | 2 (20%) | 8 (80%) | 33,8 | 32-34 |
85% mænd samlet — den stærkeste mandlige bias blandt de "amerikanske" modeller. Elsker efternavnet Wysocki (40% af svarene) og navnet Michał (57%). Alder næsten altid 34.
Gemini 3.1 Pro — genererer næppe kvinder
92% mænd samlet. Bredeste aldersfordeling (28-40). Højeste diversitet i fornavne.
| Lidelse | Kvinde | Mand | Fordeling | Gennemsnitsalder | Min-Max |
|---|---|---|---|---|---|
| OCD | 0 (0%) | 10 (100%) | 30,1 | 28-35 | |
| NPD | 0 (0%) | 10 (100%) | 36,1 | 35-40 | |
| Depression | 1 (10%) | 9 (90%) | 34,8 | 28-40 | |
| GAD | 2 (20%) | 8 (80%) | 33,7 | 28-38 |
Gemini-paradokset: højeste navnediversitet (70%) samtidig med den stærkeste mandlige bias. Foretrækker sjældnere navne (Maksymilian, Tomasz) frem for de typiske "Jan'er". Modsiger epidemiologien — den eneste model, der ikke kan generere en kvindelig patient selv ved depression eller GAD.
Grok-4 Fast — mest kønsbalanceret
52% K / 48% M samlet. Bredeste aldersinterval — 28 til 42.
| Lidelse | Kvinde | Mand | Fordeling | Gennemsnitsalder | Min-Max |
|---|---|---|---|---|---|
| OCD | 2 (20%) | 8 (80%) | 35,6 | 28-42 | |
| NPD | 0 (0%) | 10 (100%) | 39,2 | 35-42 | |
| Depression | 10 (100%) | 0 (0%) | 34,5 | 28-42 | |
| GAD | 9 (90%) | 1 (10%) | 36,0 | 28-42 |
Bedst til GAD/Depression målt på overensstemmelse med epidemiologien (90-100% K mod de reelle 65%). Den eneste model, der producerer 42-årige. Hyppigst: "Anna Kowalska, 42" eller "Marcin Nowak, 42".
DeepSeek-Chat — stærkeste navne-mode collapse
Jan Kowalski udgør 40% af alle fornavne, 55% af efternavne. Men GAD = 50/50 fordelt på køn.
| Lidelse | Kvinde | Mand | Fordeling | Gennemsnitsalder | Min-Max |
|---|---|---|---|---|---|
| OCD | 4 (40%) | 6 (60%) | 33,0 | 32-34 | |
| NPD | 0 (0%) | 10 (100%) | 34,6 | 32-42 | |
| Depression | 4 (40%) | 6 (60%) | 32,8 | 32-34 | |
| GAD | 5 (50%) | 5 (50%) | 33,0 | 32-34 |
Paradoksalt nok — mest kønsbalanceret ved GAD (50/50), selvom "Kowalski" optræder i 22 af 40 svar (55%). Det mest "lærebogsagtige" polske output (mest populære efternavn + mest populære mandlige fornavn).
Hver model har en "yndlingspatient"
Det hyppigst genererede fornavn + efternavn + alder for hvert model × lidelse-par. Tal i parentes = antal forekomster ud af 10 forespørgsler.
| Model | OCD | NPD | Depression | GAD |
|---|---|---|---|---|
| claude-opus-4.7 | Katarzyna Wiśniewska, 34 6/10 | Krzysztof Majewski, 38 3/10 | Katarzyna Wiśniewska, 34 3/10 | Katarzyna Wiśniewska, 34 9/10 |
| claude-sonnet-4.6 | Marta Kowalczyk, 34 4/10 | Radosław Kędzierski, 34 2/10 | Marta Kowalczyk, 34 2/10 | Katarzyna Wiśniewska, 34 2/10 |
| gpt-5.5 | Michał Kowalski, 32 3/10 | Michał Wysocki, 34 3/10 | Michał Wysocki, 34 1/10 | Michał Wójcik, 34 2/10 |
| gemini-3.1-pro | Tomasz Kamiński, 28 2/10 | Maksymilian + diverse 1/10 | diverse 1/10 | Michał Wiśniewski, 35 2/10 |
| grok-4-fast | Michał Nowak, 28 2/10 | Michał Nowak, 42 2/10 | Maria Nowak, 32 2/10 | Anna Kowalska, 42 2/10 |
| deepseek-chat | Jan Kowalski, 32 4/10 | Jan Kowalski, 34 3/10 | Jan Kowalski, 32 5/10 | Jan Kowalski, 32 4/10 |
Diversitetsrangering (unikt fulde navn / total)
| Model | Diversitet | Topfornavn | Topefternavn | Mode collapse |
|---|---|---|---|---|
| gemini-3.1-pro | 70% | Tomasz (32%) | Wiśniewski (25%) | 🟢 lav |
| gpt-5.5 | 52% | Michał (57%) | Wysocki (40%) | 🟡 mellem |
| claude-sonnet-4.6 | 48% | Katarzyna (20%) | Kowalczyk (22%) | 🟡 mellem |
| grok-4-fast | 45% | Anna (28%) | Nowak (42%) | 🟡 mellem |
| deepseek-chat | 35% | Jan (40%) | Kowalski (55%) | 🔴 høj |
| claude-opus-4.7 | 32% | Katarzyna (75%) | Wiśniewska (50%) | 🔴 høj |
Hvad dette betyder for TherapySupport
Praktiske konklusioner fra undersøgelsen — hvor LLM-bias kan sive ind i det terapeutiske arbejde, og hvor man bør gribe ind.
Modelbias kan forme klinisk intuition
Når modellen "foreslår" scenarier, gør den det i retning af sin egen arketype
Modeller, der bruges til at generere eksempelcases (case studies, træningsmockups, undervisningsmateriale), forstærker systematisk stereotyper. En kliniker, der bruger en LLM til brainstorming, får en bias-filtreret liste af idéer — f.eks. altid en kvinde med angst, altid en mand med NPD.
Atypiske patienter bliver usynlige
En mand med GAD, en kvinde med NPD — modellerne "ser" dem simpelthen ikke
Hvis modellerne genererer 100% mandlige NPD-patienter og 100% kvindelige GAD-patienter (Opus, Grok), udelukker deres "patientvokabular" de reelle tilfælde med det ikke-dominerende køn. Dette har betydning for AI-assisteret sessionsresumé, diagnostiske forslag eller automatisk tagging.
Valg af model har betydning
Til undervisningsopgaver bør man foretrække en "varieret" model frem for en "koncentreret" en
Hvis målet er diversitet i eksemplerne (f.eks. træningsmateriale, der viser bredden af patienter) — vælg Gemini 3.1 Pro eller Grok-4 Fast. Hvis målet er en "lærebogsagtig" prototypepatient (f.eks. en case til UI-test) — vælg Claude Opus eller DeepSeek (stærkeste mode).
| Mål | Anbefalet model | Hvorfor |
|---|---|---|
| Træningsmateriale | Gemini 3.1 Pro · Grok-4 | Højest diversitet i navne og alder |
| UI-test / mock-data | DeepSeek · Claude Opus | Stabile, "modale" arketyper |
| Kønsbalancerede datasæt | Grok-4 Fast | 52% K / 48% M samlet |
| Diversitetsbevidst forskning | Kombinér output fra 3+ modeller | Forskellige biases ophæver hinanden |
Mitigering ved arbejde med LLM'er
Konkrete prompt- og valideringsteknikker, der reducerer bias
- Tving demografisk variation i prompten: "Generér en 22-årig kvindelig patient med NPD" i stedet for et åbent "generér en patient med NPD".
- Brug seeds / flere kald: generér 5-10 kandidater og udvælg tilfældigt i stedet for at tage den første.
- Kombinér svar på tværs af modeller: et aggregat af Gemini + Grok + DeepSeek giver en langt bredere fordeling end en enkelt model.
- Audit outputtet: én gang i kvartalet — generér N=100 svar og undersøg fordelingen af køn, alder, efternavne. Mønstrene ændrer sig med hver ny modelversion.
Kildedata og replikation
Alle 240 rå svar er tilgængelige efter anmodning. Replikationsscripts kan også fås efter anmodning.
| Element | Værdi |
|---|---|
| Antal forespørgsler | 240 (6 modeller × 4 lidelser × 10 gentagelser) |
| Temperatur | 0,9 |
| Max tokens | 60 (200 for GPT-5.5, 2000 for Gemini 3.1) |
| Hvordan kaldt | HTTPS POST til OpenRouter API, parallelt (asyncio + httpx) |
| Samtidighed | 20 (semafor) |
| Samlet tid | ~3 min. for 240 kald |
| Sprog | Polsk (prompt og forventet output) |
| Kønsklassificering | Heuristik: fornavn der ender på "a" → kvinde, ellers → mand (typisk for polsk) |
Undersøgelsens begrænsninger
- Lille stikprøve pr. celle: 10 gentagelser er for få til streng statistisk signifikans. Resultaterne beskriver en tendens, ikke et bevis.
- Kønsheuristik: klassificering efter navneendelse er ufuldkommen (fx "Kuba", "Bonifacy"). I praksis fungerer den >95% for polske navne.
- Kun 4 lidelser: for et fyldigere billede bør man udvide til BPD, ADHD, skizofreni, PTSD, autisme.
- Kun polsk kontekst: bias kan se meget anderledes ud for engelske, tyske eller spanske patienter.
- Øjebliksbillede: resultaterne gælder for modelversionerne fra april 2026. Efter modelopdateringer kan mønstrene ændre sig.
Download rådata (19 KB)
Skriv din e-mail — vi sender dig ZIP-filen: alle 240 LLM-svar (results.json), samlede rapporter (final_report.md, per_model_report.md) og Python-scripts til at genskabe eksperimentet.
CC-BY 4.0 · Ingen paywall · Ingen salgsopfølgning.