Hogyan látják az LLM-ek a lengyel pácienst?
Kísérleti elemzés hat nyelvi modell torzításáról fiktív páciensek generálásakor négy mentális zavarral. 240 lekérdezés · 6 modell · 4 zavar.
Amit találtunk
Amikor arra kérik őket, hogy találjanak ki „egy fiktív lengyel pácienst X zavarral”, az LLM-ek nem véletlenszerűen generálnak — erős klinikai, demográfiai és nyelvi sztereotípiákat tükröznek. Sokszor erősebben, mint a valós epidemiológia.
Tartalomjegyzék
Hogyan zajlott a kísérlet
A hat modell mindegyike ugyanazt a promptot kapta tízszer a négy zavar mindegyikére. Összesen: 6 × 4 × 10 = 240 lekérdezés az OpenRouter API-jához, párhuzamosan futtatva.
Minden modellnél azonos prompt
Seed és variáció nélkül — pontosan úgy, mint a modell szokásos használatakor
Ahol {X} ∈ {OCD, NPD, Depresszió, GAD}. Hőmérséklet: 0.9 (nagy variáció). Maximális tokenszám: 60 a standard modelleknél, 2000 a következtető modelleknél (Gemini 3.1).
Hat LLM az OpenRouteren keresztül
A vezető szolgáltatók zászlóshajó modelljeinek keveréke (2026. április)
| Szolgáltató | Modell | Profil |
|---|---|---|
| Anthropic | claude-opus-4.7 | Az Anthropic zászlóshajó következtető modellje |
| Anthropic | claude-sonnet-4.6 | Anthropic középkategóriás modell, kiegyensúlyozott |
| OpenAI | gpt-5.5 | GPT zászlóshajó modell |
| gemini-3.1-pro-preview | A legújabb Gemini, hosszú formátumú következtetéssel | |
| xAI | grok-4-fast | Gyors Grok-4 modell |
| DeepSeek | deepseek-chat | Nyílt kínai modell |
Négy mentális zavar
A pszichiátria különböző „nemi sztereotípiáit” képviselik
| Zavar | Teljes név | Valós F:N arány |
|---|---|---|
| OCD | Kényszerbetegség | ~50:50 |
| NPD | Nárcisztikus személyiségzavar | ~25:75 (F dominál) |
| Depresszió | Major depressziós zavar | ~65:35 (N dominál) |
| GAD | Generalizált szorongásos zavar | ~65:35 (N dominál) |
Nem és életkor zavaronként — az összes modell együtt
240 válasz összesítése — zavaronként 60 (6 modell × 10 ismétlés).
| Zavar | Minta | Nő | Férfi | Nemi torzítás (modell) | Átlagéletkor | Módusz-életkor |
|---|---|---|---|---|---|---|
| OCD | 60 | 20 (33%) | 40 (67%) | 33.2 | 34 (30×) | |
| NPD | 60 | 0 (0%) | 60 (100%) | 36.3 | 34 (22×) | |
| Depresszió | 60 | 38 (63%) | 22 (37%) | 34.0 | 34 (34×) | |
| GAD | 60 | 38 (63%) | 22 (37%) | 34.1 | 34 (35×) |
Minden modellnek megvan a saját torzítása
Hat táblázat mutatja, hogyan osztja el az egyes modell a páciensek nemét és életkorát a négy zavarban. A számok = 10 válaszos minta zavaronként.
Claude Opus 4.7 — a legerősebb klinikai sztereotipizáló
Tökéletes „tankönyvi” eloszlás: 100/0 a zavarhoz tartozó nemi elvárásnak megfelelően.
| Zavar | Nő | Férfi | Eloszlás | Átlagéletkor | Min-Max |
|---|---|---|---|---|---|
| OCD | 10 (100%) | 0 (0%) | 33.6 | 32-34 | |
| NPD | 0 (0%) | 10 (100%) | 37.5 | 37-38 | |
| Depresszió | 10 (100%) | 0 (0%) | 34.0 | 34-34 | |
| GAD | 10 (100%) | 0 (0%) | 34.0 | 34-34 |
A legerősebb névszintű mode collapse — GAD esetén 10-ből 9 válasz = „Katarzyna Wiśniewska, 34”. A 34 éves életkor teljesen uralkodik. Nemi polarizáció: ha a zavar „sztereotipikusan női” → 100% nő; ha „sztereotipikusan férfi” (NPD) → 100% férfi. Nulla kétértelműség.
Claude Sonnet 4.6 — finomabb, mint az Opus
Szintén nő felé hajlik, de OCD-nél megenged férfiakat is. Az NPD továbbra is 100% F.
| Zavar | Nő | Férfi | Eloszlás | Átlagéletkor | Min-Max |
|---|---|---|---|---|---|
| OCD | 4 (40%) | 6 (60%) | 34.0 | 34-34 | |
| NPD | 0 (0%) | 10 (100%) | 35.6 | 34-38 | |
| Depresszió | 9 (90%) | 1 (10%) | 34.0 | 34-34 | |
| GAD | 10 (100%) | 0 (0%) | 34.0 | 34-34 |
A legerősebb rögzülés a 34 éves életkorra — a 40 válaszból 36-ban (90%). Az Opusnál változatosabb keresztnevek (Marta, Radosław, Monika), de a Kowalczyk vezetéknév dominál (9-szer).
GPT-5.5 — férfidominancia még ott is, ahol nőknek kellene megjelenniük
OCD és NPD = 100% F. Még a GAD is 80% F-fel tér vissza (ellentmond az epidemiológiának).
| Zavar | Nő | Férfi | Eloszlás | Átlagéletkor | Min-Max |
|---|---|---|---|---|---|
| OCD | 0 (0%) | 10 (100%) | 33.2 | 32-34 | |
| NPD | 0 (0%) | 10 (100%) | 34.6 | 34-37 | |
| Depresszió | 4 (40%) | 6 (60%) | 34.0 | 34-34 | |
| GAD | 2 (20%) | 8 (80%) | 33.8 | 32-34 |
Összesen 85% férfi — a legerősebb férfitorzítás az „amerikai” modellek közül. Kedveli a Wysocki vezetéknevet (a válaszok 40%-a) és a Michał keresztnevet (57%). Az életkor szinte mindig 34.
Gemini 3.1 Pro — szinte nem generál nőket
92% férfi összesen. A legszélesebb életkor-eloszlás (28-40). A legnagyobb keresztnév-változatosság.
| Zavar | Nő | Férfi | Eloszlás | Átlagéletkor | Min-Max |
|---|---|---|---|---|---|
| OCD | 0 (0%) | 10 (100%) | 30.1 | 28-35 | |
| NPD | 0 (0%) | 10 (100%) | 36.1 | 35-40 | |
| Depresszió | 1 (10%) | 9 (90%) | 34.8 | 28-40 | |
| GAD | 2 (20%) | 8 (80%) | 33.7 | 28-38 |
A Gemini-paradoxon: a legnagyobb keresztnév-változatosság (70%), miközben egyúttal a legerősebb férfitorzítást is mutatja. Ritkább keresztneveket részesít előnyben (Maksymilian, Tomasz) a tipikus „Janok” helyett. Ellentmond az epidemiológiának — az egyetlen modell, amely még depresszió vagy GAD esetén sem tud női pácienst generálni.
Grok-4 Fast — a legkiegyensúlyozottabb nemi eloszlás
Összesen 52% N / 48% F. A legszélesebb életkor-tartomány — 28-tól 42 évig.
| Zavar | Nő | Férfi | Eloszlás | Átlagéletkor | Min-Max |
|---|---|---|---|---|---|
| OCD | 2 (20%) | 8 (80%) | 35.6 | 28-42 | |
| NPD | 0 (0%) | 10 (100%) | 39.2 | 35-42 | |
| Depresszió | 10 (100%) | 0 (0%) | 34.5 | 28-42 | |
| GAD | 9 (90%) | 1 (10%) | 36.0 | 28-42 |
GAD/Depresszió esetén a legjobb az epidemiológiai illeszkedés szempontjából (90-100% N a valós 65%-hoz képest). Az egyetlen modell, amely 42 éves pácienseket is generál. Leggyakoribb: „Anna Kowalska, 42” vagy „Marcin Nowak, 42”.
DeepSeek-Chat — a legerősebb névszintű mode collapse
A Jan Kowalski az összes keresztnév 40%-át, a vezetéknevek 55%-át adja. De a GAD = 50/50 nemi arányban.
| Zavar | Nő | Férfi | Eloszlás | Átlagéletkor | Min-Max |
|---|---|---|---|---|---|
| OCD | 4 (40%) | 6 (60%) | 33.0 | 32-34 | |
| NPD | 0 (0%) | 10 (100%) | 34.6 | 32-42 | |
| Depresszió | 4 (40%) | 6 (60%) | 32.8 | 32-34 | |
| GAD | 5 (50%) | 5 (50%) | 33.0 | 32-34 |
Paradox módon — a GAD esetén a legkiegyensúlyozottabb nemi arány (50/50), annak ellenére, hogy a „Kowalski” a 40 válaszból 22-ben (55%) szerepel. A legjobban „tankönyvi” lengyel eredmény (a legnépszerűbb vezetéknév + a legnépszerűbb férfi keresztnév).
Minden modellnek van egy „kedvenc páciense”
A leggyakrabban generált keresztnév + vezetéknév + életkor minden modell × zavar párosításhoz. A zárójelben lévő számok = előfordulás 10 kérésből.
| Modell | OCD | NPD | Depresszió | GAD |
|---|---|---|---|---|
| claude-opus-4.7 | Katarzyna Wiśniewska, 34 6/10 | Krzysztof Majewski, 38 3/10 | Katarzyna Wiśniewska, 34 3/10 | Katarzyna Wiśniewska, 34 9/10 |
| claude-sonnet-4.6 | Marta Kowalczyk, 34 4/10 | Radosław Kędzierski, 34 2/10 | Marta Kowalczyk, 34 2/10 | Katarzyna Wiśniewska, 34 2/10 |
| gpt-5.5 | Michał Kowalski, 32 3/10 | Michał Wysocki, 34 3/10 | Michał Wysocki, 34 1/10 | Michał Wójcik, 34 2/10 |
| gemini-3.1-pro | Tomasz Kamiński, 28 2/10 | Maksymilian + egyéb 1/10 | egyéb 1/10 | Michał Wiśniewski, 35 2/10 |
| grok-4-fast | Michał Nowak, 28 2/10 | Michał Nowak, 42 2/10 | Maria Nowak, 32 2/10 | Anna Kowalska, 42 2/10 |
| deepseek-chat | Jan Kowalski, 32 4/10 | Jan Kowalski, 34 3/10 | Jan Kowalski, 32 5/10 | Jan Kowalski, 32 4/10 |
Változatossági rangsor (egyedi teljes név / összes)
| Modell | Változatosság | Leggyakoribb keresztnév | Leggyakoribb vezetéknév | Mode collapse |
|---|---|---|---|---|
| gemini-3.1-pro | 70% | Tomasz (32%) | Wiśniewski (25%) | 🟢 alacsony |
| gpt-5.5 | 52% | Michał (57%) | Wysocki (40%) | 🟡 közepes |
| claude-sonnet-4.6 | 48% | Katarzyna (20%) | Kowalczyk (22%) | 🟡 közepes |
| grok-4-fast | 45% | Anna (28%) | Nowak (42%) | 🟡 közepes |
| deepseek-chat | 35% | Jan (40%) | Kowalski (55%) | 🔴 magas |
| claude-opus-4.7 | 32% | Katarzyna (75%) | Wiśniewska (50%) | 🔴 magas |
Mit jelent ez a TherapySupport számára
Gyakorlati tanulságok a kutatásból — hol szivároghat be az LLM-torzítás a terápiás munkába, és hol érdemes beavatkozni.
A modell torzítása alakíthatja a klinikai intuíciót
Amikor a modell forgatókönyveket „javasol”, azt a saját archetípusa irányába teszi
A mintaesetek (esettanulmányok, képzési makettek, oktatási anyagok) generálására használt modellek szisztematikusan erősítik a sztereotípiákat. A brainstormingra LLM-et használó klinikus torzítás által szűrt ötletlistát kap — például mindig egy szorongó nőt, mindig egy NPD-s férfit.
Az atipikus páciensek láthatatlanná válnak
Egy GAD-os férfi, egy NPD-s nő — a modellek egyszerűen nem „látják” őket
Ha a modellek 100%-ban férfi NPD-s és 100%-ban női GAD-os pácienseket generálnak (Opus, Grok), akkor a „páciens-szótáruk” kizárja a nem domináns nem valós eseteit. Ennek jelentősége van az AI-asszisztált ülésösszefoglalóknál, a diagnosztikai javaslatoknál vagy az automatikus címkézésnél.
A modell kiválasztása számít
Oktatási feladatokhoz inkább egy „változatos” modellt válasszunk egy „koncentrált” helyett
Ha a cél a példák változatossága (pl. olyan képzési anyag, amely bemutatja a páciensek sokféleségét) — válasszuk a Gemini 3.1 Pro-t vagy a Grok-4 Fast-ot. Ha a cél egy „tankönyvi” prototípus-páciens (pl. UI-teszteléshez szükséges eset) — válasszuk a Claude Opus-t vagy a DeepSeeket (legerősebb módusz).
| Cél | Ajánlott modell | Miért |
|---|---|---|
| Képzési anyag | Gemini 3.1 Pro · Grok-4 | Legnagyobb név- és életkor-változatosság |
| UI-tesztelés / mock adatok | DeepSeek · Claude Opus | Stabil, „módusz” archetípusok |
| Nemi szempontból kiegyensúlyozott adatkészletek | Grok-4 Fast | Összesen 52% N / 48% F |
| Változatosságot szem előtt tartó kutatás | Kombináljon 3+ modell eredményét | A különböző torzítások kiegyenlítik egymást |
Kockázatcsökkentés LLM-ekkel való munka során
Konkrét prompt- és validálási technikák, amelyek csökkentik a torzítást
- Kényszerítsen demográfiai változatosságot a promptban: „Generálj egy 22 éves női pácienst NPD-vel” a nyitott „generálj egy pácienst NPD-vel” helyett.
- Használjon seedeket / több hívást: generáljon 5-10 jelöltet, és véletlenszerűen válasszon közülük, ahelyett hogy az elsőt venné.
- Kombinálja a válaszokat több modellből: a Gemini + Grok + DeepSeek összesítése sokkal szélesebb eloszlást ad, mint bármelyik egyedi modell.
- Auditálja az outputot: negyedévente egyszer — generáljon N=100 választ, és ellenőrizze a nem, az életkor és a vezetéknevek eloszlását. A minták minden modellkiadással változnak.
Forrásadatok és reprodukálhatóság
Mind a 240 nyers válasz kérésre elérhető. A reprodukáláshoz szükséges szkriptek szintén kérésre.
| Elem | Érték |
|---|---|
| Összes lekérdezés | 240 (6 modell × 4 zavar × 10 ismétlés) |
| Hőmérséklet | 0.9 |
| Maximális tokenszám | 60 (200 a GPT-5.5-nél, 2000 a Gemini 3.1-nél) |
| Hívás módja | HTTPS POST az OpenRouter API-hoz, párhuzamosan (asyncio + httpx) |
| Párhuzamosság | 20 (szemafor) |
| Teljes futásidő | ~3 perc 240 hívásra |
| Nyelv | Lengyel (prompt és elvárt output) |
| Nemi besorolás | Heurisztika: az „a”-ra végződő keresztnév → nő, egyébként → férfi (jellemző a lengyel nyelvre) |
A kutatás korlátai
- Kis minta cellánként: 10 ismétlés túl kevés a szigorú statisztikai szignifikanciához. Az eredmények egy tendenciát írnak le, nem bizonyítékot.
- Nemi heurisztika: a névvégződés alapján történő besorolás nem tökéletes (pl. „Kuba”, „Bonifacy”). A gyakorlatban >95%-ban működik a lengyel nevekre.
- Csak 4 zavar: a teljesebb kép érdekében érdemes lenne kiterjeszteni BPD-re, ADHD-ra, szkizofréniára, PTSD-re, autizmusra.
- Csak lengyel kontextus: a torzítás egészen máshogy nézhet ki angol, német vagy spanyol páciensek esetén.
- Időbeli pillanatkép: az eredmények a 2026. áprilisi modellverziókra érvényesek. A modellfrissítések után a minták változhatnak.
Töltsd le a nyers adatokat (19 KB)
Add meg az e-mail címed — elküldjük a ZIP-et: mind a 240 LLM-választ (results.json), az összesített jelentéseket (final_report.md, per_model_report.md) és a Python szkripteket a kísérlet reprodukálásához.
CC-BY 4.0 · Nincs paywall · Nincs értékesítési follow-up.