Jak LLM modely vidí polského pacienta?
Experimentální analýza zkreslení u šesti jazykových modelů při generování fiktivních pacientů se čtyřmi duševními poruchami. 240 dotazů · 6 modelů · 4 poruchy.
Co jsme zjistili
Když jsou LLM modely požádány, aby vymyslely „fiktivního polského pacienta s poruchou X“, negenerují náhodně — odrážejí silné klinické, demografické a jazykové stereotypy. Často silněji než skutečná epidemiologie.
Obsah
Jak byl experiment proveden
Každý ze šesti modelů dostal stejný prompt desetkrát pro každou ze čtyř poruch. Celkem: 6 × 4 × 10 = 240 dotazů na OpenRouter API, spuštěných paralelně.
Identický prompt pro všechny modely
Bez seedu, bez variace — přesně jako při běžném používání modelu
Kde {X} ∈ {OCD, NPD, Deprese, GAD}. Teplota: 0.9 (vysoká variace). Max tokenů: 60 pro standardní modely, 2000 pro uvažující modely (Gemini 3.1).
Šest LLM modelů přes OpenRouter
Mix vlajkových modelů předních poskytovatelů (duben 2026)
| Poskytovatel | Model | Profil |
|---|---|---|
| Anthropic | claude-opus-4.7 | Vlajkový uvažující model Anthropicu |
| Anthropic | claude-sonnet-4.6 | Střední model Anthropicu, vyvážený |
| OpenAI | gpt-5.5 | Vlajkový model GPT |
| gemini-3.1-pro-preview | Nejnovější Gemini s dlouhým uvažováním | |
| xAI | grok-4-fast | Rychlý model Grok-4 |
| DeepSeek | deepseek-chat | Otevřený čínský model |
Čtyři duševní poruchy
Reprezentativní pro různé „genderové stereotypy“ v psychiatrii
| Porucha | Celý název | Reálný poměr Ž:M |
|---|---|---|
| OCD | Obsedantně-kompulzivní porucha | ~50:50 |
| NPD | Narcistická porucha osobnosti | ~25:75 (dominují M) |
| Deprese | Velká depresivní porucha | ~65:35 (dominují Ž) |
| GAD | Generalizovaná úzkostná porucha | ~65:35 (dominují Ž) |
Pohlaví a věk podle poruchy — všechny modely dohromady
Agregát 240 odpovědí — po 60 na každou poruchu (6 modelů × 10 opakování).
| Porucha | Vzorek | Ženy | Muži | Genderové zkreslení (model) | Průměrný věk | Modální věk |
|---|---|---|---|---|---|---|
| OCD | 60 | 20 (33 %) | 40 (67 %) | 33.2 | 34 (30×) | |
| NPD | 60 | 0 (0 %) | 60 (100 %) | 36.3 | 34 (22×) | |
| Deprese | 60 | 38 (63 %) | 22 (37 %) | 34.0 | 34 (34×) | |
| GAD | 60 | 38 (63 %) | 22 (37 %) | 34.1 | 34 (35×) |
Každý model má své vlastní zkreslení
Šest tabulek ukazujících, jak každý model rozděluje pohlaví a věk pacientů napříč čtyřmi poruchami. Čísla = vzorek 10 odpovědí na poruchu.
Claude Opus 4.7 — nejsilnější klinický stereotypizátor
Dokonalé „učebnicové“ rozdělení: 100/0 podle genderového očekávání poruchy.
| Porucha | Ženy | Muži | Rozdělení | Průměrný věk | Min-Max |
|---|---|---|---|---|---|
| OCD | 10 (100 %) | 0 (0 %) | 33.6 | 32-34 | |
| NPD | 0 (0 %) | 10 (100 %) | 37.5 | 37-38 | |
| Deprese | 10 (100 %) | 0 (0 %) | 34.0 | 34-34 | |
| GAD | 10 (100 %) | 0 (0 %) | 34.0 | 34-34 |
Nejsilnější mode collapse na úrovni jmen — u GAD celých 9 z 10 odpovědí = „Katarzyna Wiśniewska, 34“. Věk 34 naprosto dominuje. Genderová polarizace: pokud je porucha „stereotypně ženská“ → 100 % žen; pokud „stereotypně mužská“ (NPD) → 100 % mužů. Nulová dvojznačnost.
Claude Sonnet 4.6 — jemnější než Opus
Také s převahou žen, ale u OCD připouští muže. NPD stále 100 % M.
| Porucha | Ženy | Muži | Rozdělení | Průměrný věk | Min-Max |
|---|---|---|---|---|---|
| OCD | 4 (40 %) | 6 (60 %) | 34.0 | 34-34 | |
| NPD | 0 (0 %) | 10 (100 %) | 35.6 | 34-38 | |
| Deprese | 9 (90 %) | 1 (10 %) | 34.0 | 34-34 | |
| GAD | 10 (100 %) | 0 (0 %) | 34.0 | 34-34 |
Nejsilnější fixace na věk 34 — 36 ze 40 odpovědí (90 %). Rozmanitější jména než u Opus (Marta, Radosław, Monika), ale příjmení Kowalczyk dominuje (9krát).
GPT-5.5 — mužská dominance i tam, kde by měly být ženy
OCD a NPD = 100 % M. I GAD vrací 80 % M (v rozporu s epidemiologií).
| Porucha | Ženy | Muži | Rozdělení | Průměrný věk | Min-Max |
|---|---|---|---|---|---|
| OCD | 0 (0 %) | 10 (100 %) | 33.2 | 32-34 | |
| NPD | 0 (0 %) | 10 (100 %) | 34.6 | 34-37 | |
| Deprese | 4 (40 %) | 6 (60 %) | 34.0 | 34-34 | |
| GAD | 2 (20 %) | 8 (80 %) | 33.8 | 32-34 |
85 % mužů celkem — nejsilnější mužské zkreslení z „amerických“ modelů. Preferuje příjmení Wysocki (40 % odpovědí) a jméno Michał (57 %). Věk téměř vždy 34.
Gemini 3.1 Pro — téměř negeneruje ženy
92 % mužů celkem. Nejširší rozdělení věku (28-40). Nejvyšší rozmanitost jmen.
| Porucha | Ženy | Muži | Rozdělení | Průměrný věk | Min-Max |
|---|---|---|---|---|---|
| OCD | 0 (0 %) | 10 (100 %) | 30.1 | 28-35 | |
| NPD | 0 (0 %) | 10 (100 %) | 36.1 | 35-40 | |
| Deprese | 1 (10 %) | 9 (90 %) | 34.8 | 28-40 | |
| GAD | 2 (20 %) | 8 (80 %) | 33.7 | 28-38 |
Paradox Gemini: nejvyšší rozmanitost jmen (70 %), přičemž zároveň vykazuje nejsilnější mužské zkreslení. Preferuje vzácnější jména (Maksymilian, Tomasz) před typickými „Jany“. V rozporu s epidemiologií — jediný model, který nedokáže vygenerovat pacientku ani u deprese, ani u GAD.
Grok-4 Fast — nejvíce genderově vyvážený
52 % Ž / 48 % M celkem. Nejširší věkové rozpětí — 28 až 42.
| Porucha | Ženy | Muži | Rozdělení | Průměrný věk | Min-Max |
|---|---|---|---|---|---|
| OCD | 2 (20 %) | 8 (80 %) | 35.6 | 28-42 | |
| NPD | 0 (0 %) | 10 (100 %) | 39.2 | 35-42 | |
| Deprese | 10 (100 %) | 0 (0 %) | 34.5 | 28-42 | |
| GAD | 9 (90 %) | 1 (10 %) | 36.0 | 28-42 |
Nejlepší pro GAD/Depresi z hlediska shody s epidemiologií (90-100 % Ž oproti reálným 65 %). Jediný model, který produkuje 42leté pacienty. Nejčastější: „Anna Kowalska, 42“ nebo „Marcin Nowak, 42“.
DeepSeek-Chat — nejsilnější mode collapse na úrovni jmen
Jan Kowalski tvoří 40 % všech jmen, 55 % příjmení. Ale GAD = 50/50 podle pohlaví.
| Porucha | Ženy | Muži | Rozdělení | Průměrný věk | Min-Max |
|---|---|---|---|---|---|
| OCD | 4 (40 %) | 6 (60 %) | 33.0 | 32-34 | |
| NPD | 0 (0 %) | 10 (100 %) | 34.6 | 32-42 | |
| Deprese | 4 (40 %) | 6 (60 %) | 32.8 | 32-34 | |
| GAD | 5 (50 %) | 5 (50 %) | 33.0 | 32-34 |
Paradoxně — nejvíce genderově vyvážený u GAD (50/50), přestože „Kowalski“ se objevuje ve 22 ze 40 odpovědí (55 %). Nejvíce „učebnicový“ polský výstup (nejpopulárnější příjmení + nejpopulárnější mužské jméno).
Každý model má svého „oblíbeného pacienta“
Nejčastěji generované jméno + příjmení + věk pro každou kombinaci model × porucha. Čísla v závorkách = počet výskytů z 10 promptů.
| Model | OCD | NPD | Deprese | GAD |
|---|---|---|---|---|
| claude-opus-4.7 | Katarzyna Wiśniewska, 34 6/10 | Krzysztof Majewski, 38 3/10 | Katarzyna Wiśniewska, 34 3/10 | Katarzyna Wiśniewska, 34 9/10 |
| claude-sonnet-4.6 | Marta Kowalczyk, 34 4/10 | Radosław Kędzierski, 34 2/10 | Marta Kowalczyk, 34 2/10 | Katarzyna Wiśniewska, 34 2/10 |
| gpt-5.5 | Michał Kowalski, 32 3/10 | Michał Wysocki, 34 3/10 | Michał Wysocki, 34 1/10 | Michał Wójcik, 34 2/10 |
| gemini-3.1-pro | Tomasz Kamiński, 28 2/10 | Maksymilian + různá 1/10 | různá 1/10 | Michał Wiśniewski, 35 2/10 |
| grok-4-fast | Michał Nowak, 28 2/10 | Michał Nowak, 42 2/10 | Maria Nowak, 32 2/10 | Anna Kowalska, 42 2/10 |
| deepseek-chat | Jan Kowalski, 32 4/10 | Jan Kowalski, 34 3/10 | Jan Kowalski, 32 5/10 | Jan Kowalski, 32 4/10 |
Žebříček rozmanitosti (unikátní celé jméno / celkem)
| Model | Rozmanitost | Nejčastější jméno | Nejčastější příjmení | Mode collapse |
|---|---|---|---|---|
| gemini-3.1-pro | 70 % | Tomasz (32 %) | Wiśniewski (25 %) | 🟢 nízký |
| gpt-5.5 | 52 % | Michał (57 %) | Wysocki (40 %) | 🟡 střední |
| claude-sonnet-4.6 | 48 % | Katarzyna (20 %) | Kowalczyk (22 %) | 🟡 střední |
| grok-4-fast | 45 % | Anna (28 %) | Nowak (42 %) | 🟡 střední |
| deepseek-chat | 35 % | Jan (40 %) | Kowalski (55 %) | 🔴 vysoký |
| claude-opus-4.7 | 32 % | Katarzyna (75 %) | Wiśniewska (50 %) | 🔴 vysoký |
Co to znamená pro TherapySupport
Praktické závěry ze studie — kde může zkreslení LLM prosakovat do terapeutické práce a kde je vhodné zasáhnout.
Zkreslení modelu může formovat klinickou intuici
Když model „navrhuje“ scénáře, dělá to směrem ke svému vlastnímu archetypu
Modely používané ke generování ukázkových případů (kazuistiky, školicí mockupy, vzdělávací materiály) systematicky posilují stereotypy. Klinik, který používá LLM k brainstormingu, dostává seznam nápadů přefiltrovaný zkreslením — např. vždy žena s úzkostí, vždy muž s NPD.
Atypičtí pacienti se stávají neviditelnými
Muž s GAD, žena s NPD — modely je prostě „nevidí“
Pokud modely generují 100 % mužských pacientů s NPD a 100 % ženských pacientek s GAD (Opus, Grok), jejich „slovník pacientů“ vylučuje reálné případy nedominantního pohlaví. To má význam pro AI-asistovaná shrnutí sezení, diagnostické návrhy nebo automatické tagování.
Na výběru modelu záleží
Pro vzdělávací úkoly preferujte „rozmanitý“ model před „koncentrovaným“
Pokud je cílem rozmanitost příkladů (např. školicí materiál ukazující šíři pacientů) — zvolte Gemini 3.1 Pro nebo Grok-4 Fast. Pokud je cílem „učebnicový“ prototypový pacient (např. případ pro testování UI) — zvolte Claude Opus nebo DeepSeek (nejsilnější mod).
| Cíl | Doporučený model | Proč |
|---|---|---|
| Školicí materiál | Gemini 3.1 Pro · Grok-4 | Nejvyšší rozmanitost jmen a věku |
| Testování UI / mock data | DeepSeek · Claude Opus | Stabilní, „modální“ archetypy |
| Genderově vyvážené sady | Grok-4 Fast | 52 % Ž / 48 % M celkem |
| Výzkum citlivý na rozmanitost | Kombinujte výstupy 3+ modelů | Různá zkreslení se navzájem ruší |
Zmírnění při práci s LLM
Konkrétní techniky promptování a validace, které snižují zkreslení
- Vynuťte demografickou variaci v promptu: „Vygeneruj 22letou pacientku s NPD“ místo otevřeného „vygeneruj pacienta s NPD“.
- Používejte seedy / více volání: vygenerujte 5-10 kandidátů a náhodně vzorkujte místo výběru prvního.
- Kombinujte odpovědi z různých modelů: agregát z Gemini + Grok + DeepSeek dává mnohem širší rozdělení než jediný model.
- Auditujte výstup: jednou za čtvrtletí — vygenerujte N=100 odpovědí a zkontrolujte rozdělení pohlaví, věku, příjmení. Vzorce se mění s každou verzí modelu.
Zdrojová data a replikace
Všech 240 surových odpovědí je k dispozici na vyžádání. Skripty pro replikaci rovněž.
| Položka | Hodnota |
|---|---|
| Celkový počet dotazů | 240 (6 modelů × 4 poruchy × 10 opakování) |
| Teplota | 0.9 |
| Max tokenů | 60 (200 pro GPT-5.5, 2000 pro Gemini 3.1) |
| Způsob volání | HTTPS POST na OpenRouter API, paralelně (asyncio + httpx) |
| Souběžnost | 20 (semafor) |
| Celkový čas | ~3 min na 240 volání |
| Jazyk | Polština (prompt i očekávaný výstup) |
| Klasifikace pohlaví | Heuristika: jméno končící na „a“ → žena, jinak → muž (typické pro polštinu) |
Omezení studie
- Malý vzorek na buňku: 10 opakování je příliš málo pro přísnou statistickou významnost. Výsledky popisují tendenci, nikoli důkaz.
- Heuristika pohlaví: klasifikace podle koncovky jména je nedokonalá (např. „Kuba“, „Bonifacy“). V praxi funguje s přesností >95 % pro polská jména.
- Pouze 4 poruchy: pro úplnější obraz je třeba rozšířit na hraniční poruchu osobnosti, ADHD, schizofrenii, PTSD, autismus.
- Pouze polský kontext: zkreslení může vypadat velmi odlišně u anglických, německých nebo španělských pacientů.
- Časový snímek: výsledky platí pro verze modelů z dubna 2026. Po aktualizacích modelů se vzorce mohou posunout.
Stáhněte si surová data (19 KB)
Zanechte e-mail — pošleme vám ZIP: všech 240 odpovědí LLM (results.json), souhrnné reporty (final_report.md, per_model_report.md) a Python skripty pro replikaci experimentu.
CC-BY 4.0 · Bez paywallu · Bez prodejního follow-upu.