Hvordan ser LLM-er en polsk pasient?
En eksperimentell analyse av bias hos seks språkmodeller ved generering av fiktive pasienter med fire psykiske lidelser. 240 forespørsler · 6 modeller · 4 lidelser.
Hva vi fant
Når LLM-er blir bedt om å finne på «en fiktiv polsk pasient med lidelse X», genererer de ikke tilfeldig — de gjenspeiler sterke kliniske, demografiske og språklige stereotypier. Ofte sterkere enn den virkelige epidemiologien.
Innholdsfortegnelse
Slik ble eksperimentet gjennomført
Hver av de seks modellene fikk den samme prompten ti ganger for hver av de fire lidelsene. Totalt: 6 × 4 × 10 = 240 forespørsler til OpenRouter API, kjørt parallelt.
Identisk prompt for alle modeller
Ingen seed, ingen variasjon — akkurat som ved normal bruk av modellen
Der {X} ∈ {OCD, NPD, Depression, GAD}. Temperatur: 0.9 (høy variasjon). Maks tokens: 60 for standardmodeller, 2000 for resonnerende modeller (Gemini 3.1).
Seks LLM-er via OpenRouter
En blanding av flaggskipsmodeller fra ledende leverandører (april 2026)
| Leverandør | Modell | Profil |
|---|---|---|
| Anthropic | claude-opus-4.7 | Anthropics flaggskip-resonneringsmodell |
| Anthropic | claude-sonnet-4.6 | Anthropics mellomklasse, balansert |
| OpenAI | gpt-5.5 | GPT-flaggskip |
| gemini-3.1-pro-preview | Nyeste Gemini med langformet resonnement | |
| xAI | grok-4-fast | Rask Grok-4-modell |
| DeepSeek | deepseek-chat | Åpen kinesisk modell |
Fire psykiske lidelser
Representative for ulike «kjønnsstereotypier» i psykiatrien
| Lidelse | Fullt navn | Reell fordeling K:M |
|---|---|---|
| OCD | Tvangslidelse | ~50:50 |
| NPD | Narsissistisk personlighetsforstyrrelse | ~25:75 (M dominerer) |
| Depression | Alvorlig depresjon | ~65:35 (K dominerer) |
| GAD | Generalisert angstlidelse | ~65:35 (K dominerer) |
Kjønn og alder per lidelse — alle modeller samlet
Aggregert fra 240 svar — 60 per lidelse (6 modeller × 10 repetisjoner).
| Lidelse | Utvalg | Kvinne | Mann | Kjønnsbias (modell) | Gjennomsnittsalder | Modal alder |
|---|---|---|---|---|---|---|
| OCD | 60 | 20 (33%) | 40 (67%) | 33.2 | 34 (30×) | |
| NPD | 60 | 0 (0%) | 60 (100%) | 36.3 | 34 (22×) | |
| Depression | 60 | 38 (63%) | 22 (37%) | 34.0 | 34 (34×) | |
| GAD | 60 | 38 (63%) | 22 (37%) | 34.1 | 34 (35×) |
Hver modell har sin egen bias
Seks tabeller som viser hvordan hver modell fordeler pasienters kjønn og alder på tvers av de fire lidelsene. Tall = utvalg på 10 svar per lidelse.
Claude Opus 4.7 — den sterkeste kliniske stereotypbæreren
Perfekt «lærebokaktig» fordeling: 100/0 som matcher lidelsens kjønnsforventning.
| Lidelse | Kvinne | Mann | Fordeling | Gjennomsnittsalder | Min-Max |
|---|---|---|---|---|---|
| OCD | 10 (100%) | 0 (0%) | 33.6 | 32-34 | |
| NPD | 0 (0%) | 10 (100%) | 37.5 | 37-38 | |
| Depression | 10 (100%) | 0 (0%) | 34.0 | 34-34 | |
| GAD | 10 (100%) | 0 (0%) | 34.0 | 34-34 |
Sterkest navnebasert mode collapse — for GAD er 9 av 10 svar = «Katarzyna Wiśniewska, 34». Alder 34 dominerer fullstendig. Kjønnspolarisering: hvis lidelsen er «stereotypt kvinnelig» → 100% kvinner; hvis «stereotypt mannlig» (NPD) → 100% menn. Ingen tvetydighet.
Claude Sonnet 4.6 — mer subtil enn Opus
Også kvinnedominert, men tillater menn ved OCD. NPD fortsatt 100% M.
| Lidelse | Kvinne | Mann | Fordeling | Gjennomsnittsalder | Min-Max |
|---|---|---|---|---|---|
| OCD | 4 (40%) | 6 (60%) | 34.0 | 34-34 | |
| NPD | 0 (0%) | 10 (100%) | 35.6 | 34-38 | |
| Depression | 9 (90%) | 1 (10%) | 34.0 | 34-34 | |
| GAD | 10 (100%) | 0 (0%) | 34.0 | 34-34 |
Sterkeste fikseringen på alder 34 — 36 av 40 svar (90%). Flere varierte fornavn enn Opus (Marta, Radosław, Monika), men etternavnet Kowalczyk dominerer (9 ganger).
GPT-5.5 — mannlig dominans selv der kvinner burde vises
OCD og NPD = 100% M. Selv GAD lander på 80% M (i strid med epidemiologien).
| Lidelse | Kvinne | Mann | Fordeling | Gjennomsnittsalder | Min-Max |
|---|---|---|---|---|---|
| OCD | 0 (0%) | 10 (100%) | 33.2 | 32-34 | |
| NPD | 0 (0%) | 10 (100%) | 34.6 | 34-37 | |
| Depression | 4 (40%) | 6 (60%) | 34.0 | 34-34 | |
| GAD | 2 (20%) | 8 (80%) | 33.8 | 32-34 |
85% menn totalt — den sterkeste mannlige biasen blant de «amerikanske» modellene. Foretrekker etternavnet Wysocki (40% av svarene) og navnet Michał (57%). Alder nesten alltid 34.
Gemini 3.1 Pro — genererer nesten ingen kvinner
92% menn totalt. Bredest aldersfordeling (28-40). Høyest mangfold i fornavn.
| Lidelse | Kvinne | Mann | Fordeling | Gjennomsnittsalder | Min-Max |
|---|---|---|---|---|---|
| OCD | 0 (0%) | 10 (100%) | 30.1 | 28-35 | |
| NPD | 0 (0%) | 10 (100%) | 36.1 | 35-40 | |
| Depression | 1 (10%) | 9 (90%) | 34.8 | 28-40 | |
| GAD | 2 (20%) | 8 (80%) | 33.7 | 28-38 |
Gemini-paradokset: høyest navnemangfold (70%) samtidig som den viser den sterkeste mannlige biasen. Foretrekker sjeldnere navn (Maksymilian, Tomasz) fremfor de typiske «Jan»-navnene. Motsier epidemiologien — den eneste modellen som ikke klarer å generere en kvinnelig pasient selv ved depresjon eller GAD.
Grok-4 Fast — mest kjønnsbalansert
52% K / 48% M totalt. Bredest aldersspenn — 28 til 42.
| Lidelse | Kvinne | Mann | Fordeling | Gjennomsnittsalder | Min-Max |
|---|---|---|---|---|---|
| OCD | 2 (20%) | 8 (80%) | 35.6 | 28-42 | |
| NPD | 0 (0%) | 10 (100%) | 39.2 | 35-42 | |
| Depression | 10 (100%) | 0 (0%) | 34.5 | 28-42 | |
| GAD | 9 (90%) | 1 (10%) | 36.0 | 28-42 |
Best for GAD/depresjon når det gjelder samsvar med epidemiologien (90-100% K mot de reelle 65%). Den eneste modellen som produserer 42-åringer. Vanligst: «Anna Kowalska, 42» eller «Marcin Nowak, 42».
DeepSeek-Chat — sterkeste navnebaserte mode collapse
Jan Kowalski utgjør 40% av alle fornavn, 55% av etternavnene. Men GAD = 50/50 fordelt på kjønn.
| Lidelse | Kvinne | Mann | Fordeling | Gjennomsnittsalder | Min-Max |
|---|---|---|---|---|---|
| OCD | 4 (40%) | 6 (60%) | 33.0 | 32-34 | |
| NPD | 0 (0%) | 10 (100%) | 34.6 | 32-42 | |
| Depression | 4 (40%) | 6 (60%) | 32.8 | 32-34 | |
| GAD | 5 (50%) | 5 (50%) | 33.0 | 32-34 |
Paradoksalt nok — mest kjønnsbalansert ved GAD (50/50), selv om «Kowalski» dukker opp i 22 av 40 svar (55%). Det mest «lærebokaktige» polske resultatet (mest populære etternavn + mest populære mannlige fornavn).
Hver modell har en «favorittpasient»
Det hyppigst genererte fornavnet + etternavnet + alderen for hver kombinasjon av modell × lidelse. Tall i parentes = antall forekomster av 10 forespørsler.
| Modell | OCD | NPD | Depression | GAD |
|---|---|---|---|---|
| claude-opus-4.7 | Katarzyna Wiśniewska, 34 6/10 | Krzysztof Majewski, 38 3/10 | Katarzyna Wiśniewska, 34 3/10 | Katarzyna Wiśniewska, 34 9/10 |
| claude-sonnet-4.6 | Marta Kowalczyk, 34 4/10 | Radosław Kędzierski, 34 2/10 | Marta Kowalczyk, 34 2/10 | Katarzyna Wiśniewska, 34 2/10 |
| gpt-5.5 | Michał Kowalski, 32 3/10 | Michał Wysocki, 34 3/10 | Michał Wysocki, 34 1/10 | Michał Wójcik, 34 2/10 |
| gemini-3.1-pro | Tomasz Kamiński, 28 2/10 | Maksymilian + diverse 1/10 | diverse 1/10 | Michał Wiśniewski, 35 2/10 |
| grok-4-fast | Michał Nowak, 28 2/10 | Michał Nowak, 42 2/10 | Maria Nowak, 32 2/10 | Anna Kowalska, 42 2/10 |
| deepseek-chat | Jan Kowalski, 32 4/10 | Jan Kowalski, 34 3/10 | Jan Kowalski, 32 5/10 | Jan Kowalski, 32 4/10 |
Mangfoldsrangering (unikt fullt navn / totalt)
| Modell | Mangfold | Vanligste fornavn | Vanligste etternavn | Mode collapse |
|---|---|---|---|---|
| gemini-3.1-pro | 70% | Tomasz (32%) | Wiśniewski (25%) | 🟢 lav |
| gpt-5.5 | 52% | Michał (57%) | Wysocki (40%) | 🟡 middels |
| claude-sonnet-4.6 | 48% | Katarzyna (20%) | Kowalczyk (22%) | 🟡 middels |
| grok-4-fast | 45% | Anna (28%) | Nowak (42%) | 🟡 middels |
| deepseek-chat | 35% | Jan (40%) | Kowalski (55%) | 🔴 høy |
| claude-opus-4.7 | 32% | Katarzyna (75%) | Wiśniewska (50%) | 🔴 høy |
Hva dette betyr for TherapySupport
Praktiske konklusjoner fra studien — hvor LLM-bias kan sive inn i det terapeutiske arbeidet, og hvor man bør gripe inn.
Modellbias kan forme klinisk intuisjon
Når modellen «foreslår» scenarioer, gjør den det mot sin egen arketype
Modeller som brukes til å generere eksempelkasus (case-studier, treningsmockups, undervisningsmateriell) forsterker systematisk stereotypier. En kliniker som bruker en LLM til idémyldring, får en biasfiltrert liste med idéer — f.eks. alltid en kvinne med angst, alltid en mann med NPD.
Atypiske pasienter blir usynlige
En mann med GAD, en kvinne med NPD — modellene «ser» dem rett og slett ikke
Hvis modellene genererer 100% mannlige NPD-pasienter og 100% kvinnelige GAD-pasienter (Opus, Grok), utelukker deres «pasientvokabular» de reelle tilfellene med det ikke-dominerende kjønnet. Dette har betydning for AI-assisterte sesjonssammendrag, diagnostiske forslag eller automatisk tagging.
Valg av modell har betydning
For undervisningsoppgaver bør man foretrekke en «variert» modell fremfor en «konsentrert» en
Hvis målet er mangfold blant eksemplene (f.eks. treningsmateriell som viser bredden av pasienter) — velg Gemini 3.1 Pro eller Grok-4 Fast. Hvis målet er en «lærebokaktig» prototypepasient (f.eks. et kasus for UI-testing) — velg Claude Opus eller DeepSeek (sterkeste modus).
| Mål | Anbefalt modell | Hvorfor |
|---|---|---|
| Treningsmateriell | Gemini 3.1 Pro · Grok-4 | Høyest mangfold i navn og alder |
| UI-testing / mock-data | DeepSeek · Claude Opus | Stabile, «modale» arketyper |
| Kjønnsbalanserte datasett | Grok-4 Fast | 52% K / 48% M totalt |
| Mangfoldsbevisst forskning | Kombiner resultater fra 3+ modeller | Ulike biaser opphever hverandre |
Tiltak ved arbeid med LLM-er
Konkrete prompt- og valideringsteknikker som reduserer bias
- Tving frem demografisk variasjon i prompten: «Generer en 22 år gammel kvinnelig pasient med NPD» i stedet for et åpent «generer en pasient med NPD».
- Bruk seeds / flere kall: generer 5-10 kandidater og velg tilfeldig i stedet for å ta den første.
- Kombiner svar på tvers av modeller: et aggregat av Gemini + Grok + DeepSeek gir en langt bredere fordeling enn én enkelt modell.
- Revider resultatet: én gang i kvartalet — generer N=100 svar og undersøk fordelingen av kjønn, alder, etternavn. Mønstrene endrer seg med hver nye modellversjon.
Kildedata og replikasjon
Alle 240 rå svar er tilgjengelige på forespørsel. Replikasjonsskript kan også fås på forespørsel.
| Element | Verdi |
|---|---|
| Antall forespørsler | 240 (6 modeller × 4 lidelser × 10 repetisjoner) |
| Temperatur | 0.9 |
| Maks tokens | 60 (200 for GPT-5.5, 2000 for Gemini 3.1) |
| Hvordan kalt | HTTPS POST til OpenRouter API, parallelt (asyncio + httpx) |
| Samtidighet | 20 (semafor) |
| Total tid | ~3 min for 240 kall |
| Språk | Polsk (prompt og forventet output) |
| Kjønnsklassifisering | Heuristikk: fornavn som ender på «a» → kvinne, ellers → mann (typisk for polsk) |
Studiens begrensninger
- Lite utvalg per celle: 10 repetisjoner er for få for streng statistisk signifikans. Resultatene beskriver en tendens, ikke et bevis.
- Kjønnsheuristikk: klassifisering etter navneendelse er ufullkommen (f.eks. «Kuba», «Bonifacy»). I praksis fungerer den >95% for polske navn.
- Kun 4 lidelser: for et fyldigere bilde bør man utvide til BPD, ADHD, schizofreni, PTSD, autisme.
- Kun polsk kontekst: bias kan se svært annerledes ut for engelske, tyske eller spanske pasienter.
- Øyeblikksbilde i tid: resultatene gjelder for modellversjonene fra april 2026. Etter modelloppdateringer kan mønstrene endre seg.
Last ned rådataene (19 KB)
Legg igjen e-posten din — vi sender deg ZIP-filen: alle 240 LLM-svar (results.json), samlerapporter (final_report.md, per_model_report.md) og Python-skriptene for å reprodusere eksperimentet.
CC-BY 4.0 · Ingen betalingsmur · Ingen salgsoppfølging.