Kā LLM redz poļu pacientu?
Sešu valodas modeļu neobjektivitātes eksperimentāla analīze, ģenerējot fiktīvus pacientus ar četriem psihiskiem traucējumiem. 240 vaicājumi · 6 modeļi · 4 traucējumi.
Ko mēs atklājām
Kad LLM tiek lūgts izdomāt "fiktīvu poļu pacientu ar X traucējumu", tie neģenerē nejauši — tie atspoguļo spēcīgus klīniskus, demogrāfiskus un lingvistiskus stereotipus. Bieži vien spēcīgāk nekā reālā epidemioloģija.
Satura rādītājs
Kā tika veikts eksperiments
Katrs no sešiem modeļiem saņēma vienu un to pašu uzvedni desmit reizes katram no četriem traucējumiem. Kopā: 6 × 4 × 10 = 240 vaicājumi OpenRouter API, izpildīti paralēli.
Identiska uzvedne visiem modeļiem
Bez sēklas, bez variācijas — tieši kā parastā modeļa lietošanā
Kur {X} ∈ {OCD, NPD, Depresija, GAD}. Temperatūra: 0,9 (augsta variācija). Maks. marķieru (tokens): 60 standarta modeļiem, 2000 spriešanas modeļiem (Gemini 3.1).
Seši LLM modeļi caur OpenRouter
Vadošo pakalpojumu sniedzēju flagmaņu modeļu kopums (2026. gada aprīlis)
| Pakalpojumu sniedzējs | Modelis | Profils |
|---|---|---|
| Anthropic | claude-opus-4.7 | Anthropic flagmaņa spriešanas modelis |
| Anthropic | claude-sonnet-4.6 | Anthropic vidējā līmeņa, sabalansēts modelis |
| OpenAI | gpt-5.5 | GPT flagmanis |
| gemini-3.1-pro-preview | Jaunākais Gemini ar garformāta spriešanu | |
| xAI | grok-4-fast | Ātrais Grok-4 modelis |
| DeepSeek | deepseek-chat | Atvērtais Ķīnas modelis |
Četri psihiskie traucējumi
Pārstāv dažādus "dzimumu stereotipus" psihiatrijā
| Traucējums | Pilns nosaukums | Reālā attiecība S:V |
|---|---|---|
| OCD | Obsesīvi kompulsīvie traucējumi | ~50:50 |
| NPD | Nartsistiskās personības traucējumi | ~25:75 (dominē V) |
| Depresija | Smaga depresija | ~65:35 (dominē S) |
| GAD | Ģeneralizēti trauksmes traucējumi | ~65:35 (dominē S) |
Dzimums un vecums pēc traucējuma — visi modeļi kopā
240 atbilžu apkopojums — pa 60 katram traucējumam (6 modeļi × 10 atkārtojumi).
| Traucējums | Izlase | Sieviete | Vīrietis | Dzimuma neobjektivitāte (modelis) | Vidējais vecums | Modālais vecums |
|---|---|---|---|---|---|---|
| OCD | 60 | 20 (33%) | 40 (67%) | 33,2 | 34 (30×) | |
| NPD | 60 | 0 (0%) | 60 (100%) | 36,3 | 34 (22×) | |
| Depresija | 60 | 38 (63%) | 22 (37%) | 34,0 | 34 (34×) | |
| GAD | 60 | 38 (63%) | 22 (37%) | 34,1 | 34 (35×) |
Katram modelim ir sava neobjektivitāte
Sešas tabulas, kas parāda, kā katrs modelis sadala pacientu dzimumu un vecumu pa četriem traucējumiem. Skaitļi = 10 atbilžu izlase katram traucējumam.
Claude Opus 4.7 — spēcīgākais klīniskais stereotipizētājs
Ideāls "mācību grāmatas" sadalījums: 100/0 atbilstoši traucējuma dzimuma sagaidāmajai vērtībai.
| Traucējums | Sieviete | Vīrietis | Sadalījums | Vidējais vecums | Min-Maks |
|---|---|---|---|---|---|
| OCD | 10 (100%) | 0 (0%) | 33,6 | 32-34 | |
| NPD | 0 (0%) | 10 (100%) | 37,5 | 37-38 | |
| Depresija | 10 (100%) | 0 (0%) | 34,0 | 34-34 | |
| GAD | 10 (100%) | 0 (0%) | 34,0 | 34-34 |
Spēcīgākais vārdu līmeņa mode collapse — GAD gadījumā 9 no 10 atbildēm = "Katarzyna Wiśniewska, 34". Vecums 34 dominē absolūti. Dzimuma polarizācija: ja traucējums ir "stereotipiski sieviešu" → 100% sieviešu; ja "stereotipiski vīriešu" (NPD) → 100% vīriešu. Nekādas neskaidrības.
Claude Sonnet 4.6 — smalkāks nekā Opus
Arī noliecas uz sieviešu pusi, taču pieļauj vīriešus OCD gadījumā. NPD joprojām 100% V.
| Traucējums | Sieviete | Vīrietis | Sadalījums | Vidējais vecums | Min-Maks |
|---|---|---|---|---|---|
| OCD | 4 (40%) | 6 (60%) | 34,0 | 34-34 | |
| NPD | 0 (0%) | 10 (100%) | 35,6 | 34-38 | |
| Depresija | 9 (90%) | 1 (10%) | 34,0 | 34-34 | |
| GAD | 10 (100%) | 0 (0%) | 34,0 | 34-34 |
Spēcīgākā fiksācija uz vecumu 34 — 36 no 40 atbildēm (90%). Vārdi daudzveidīgāki nekā Opus (Marta, Radosław, Monika), bet uzvārds Kowalczyk dominē (9 reizes).
GPT-5.5 — vīriešu dominance pat tur, kur būtu jābūt sievietēm
OCD un NPD = 100% V. Pat GAD dod 80% V (pretēji epidemioloģijai).
| Traucējums | Sieviete | Vīrietis | Sadalījums | Vidējais vecums | Min-Maks |
|---|---|---|---|---|---|
| OCD | 0 (0%) | 10 (100%) | 33,2 | 32-34 | |
| NPD | 0 (0%) | 10 (100%) | 34,6 | 34-37 | |
| Depresija | 4 (40%) | 6 (60%) | 34,0 | 34-34 | |
| GAD | 2 (20%) | 8 (80%) | 33,8 | 32-34 |
85% vīriešu kopā — spēcīgākā vīriešu neobjektivitāte starp "amerikāņu" modeļiem. Iemīļo uzvārdu Wysocki (40% atbilžu) un vārdu Michał (57%). Vecums gandrīz vienmēr 34.
Gemini 3.1 Pro — gandrīz negenerē sievietes
92% vīriešu kopumā. Plašākais vecuma sadalījums (28-40). Augstākā vārdu daudzveidība.
| Traucējums | Sieviete | Vīrietis | Sadalījums | Vidējais vecums | Min-Maks |
|---|---|---|---|---|---|
| OCD | 0 (0%) | 10 (100%) | 30,1 | 28-35 | |
| NPD | 0 (0%) | 10 (100%) | 36,1 | 35-40 | |
| Depresija | 1 (10%) | 9 (90%) | 34,8 | 28-40 | |
| GAD | 2 (20%) | 8 (80%) | 33,7 | 28-38 |
Gemini paradokss: augstākā vārdu daudzveidība (70%), vienlaikus uzrādot spēcīgāko vīriešu neobjektivitāti. Dod priekšroku retākiem vārdiem (Maksymilian, Tomasz), nevis tipiskajiem "Janiem". Pretrunā ar epidemioloģiju — vienīgais modelis, kas nespēj ģenerēt sievieti pacienti pat depresijas vai GAD gadījumā.
Grok-4 Fast — visvairāk sabalansēts pēc dzimuma
52% S / 48% V kopumā. Plašākais vecuma diapazons — no 28 līdz 42.
| Traucējums | Sieviete | Vīrietis | Sadalījums | Vidējais vecums | Min-Maks |
|---|---|---|---|---|---|
| OCD | 2 (20%) | 8 (80%) | 35,6 | 28-42 | |
| NPD | 0 (0%) | 10 (100%) | 39,2 | 35-42 | |
| Depresija | 10 (100%) | 0 (0%) | 34,5 | 28-42 | |
| GAD | 9 (90%) | 1 (10%) | 36,0 | 28-42 |
Vislabāk piemērots GAD/Depresijas gadījumā atbilstoši epidemioloģijai (90-100% S pret reālajiem 65%). Vienīgais modelis, kas rada 42 gadus vecus pacientus. Visbiežāk: "Anna Kowalska, 42" vai "Marcin Nowak, 42".
DeepSeek-Chat — spēcīgākais vārdu līmeņa mode collapse
Jan Kowalski veido 40% no visiem vārdiem, 55% no uzvārdiem. Bet GAD = 50/50 pēc dzimuma.
| Traucējums | Sieviete | Vīrietis | Sadalījums | Vidējais vecums | Min-Maks |
|---|---|---|---|---|---|
| OCD | 4 (40%) | 6 (60%) | 33,0 | 32-34 | |
| NPD | 0 (0%) | 10 (100%) | 34,6 | 32-42 | |
| Depresija | 4 (40%) | 6 (60%) | 32,8 | 32-34 | |
| GAD | 5 (50%) | 5 (50%) | 33,0 | 32-34 |
Paradoksāli — visvairāk sabalansēts pēc dzimuma GAD gadījumā (50/50), lai gan "Kowalski" parādās 22 no 40 atbildēm (55%). Visvairāk "mācību grāmatas" tipa poļu rezultāts (populārākais uzvārds + populārākais vīrieša vārds).
Katram modelim ir "iecienītākais pacients"
Biežāk ģenerētais vārds + uzvārds + vecums katram modeļa × traucējuma pārim. Skaitļi iekavās = sastopamības biežums no 10 uzvednēm.
| Modelis | OCD | NPD | Depresija | GAD |
|---|---|---|---|---|
| claude-opus-4.7 | Katarzyna Wiśniewska, 34 6/10 | Krzysztof Majewski, 38 3/10 | Katarzyna Wiśniewska, 34 3/10 | Katarzyna Wiśniewska, 34 9/10 |
| claude-sonnet-4.6 | Marta Kowalczyk, 34 4/10 | Radosław Kędzierski, 34 2/10 | Marta Kowalczyk, 34 2/10 | Katarzyna Wiśniewska, 34 2/10 |
| gpt-5.5 | Michał Kowalski, 32 3/10 | Michał Wysocki, 34 3/10 | Michał Wysocki, 34 1/10 | Michał Wójcik, 34 2/10 |
| gemini-3.1-pro | Tomasz Kamiński, 28 2/10 | Maksymilian + dažādi 1/10 | dažādi 1/10 | Michał Wiśniewski, 35 2/10 |
| grok-4-fast | Michał Nowak, 28 2/10 | Michał Nowak, 42 2/10 | Maria Nowak, 32 2/10 | Anna Kowalska, 42 2/10 |
| deepseek-chat | Jan Kowalski, 32 4/10 | Jan Kowalski, 34 3/10 | Jan Kowalski, 32 5/10 | Jan Kowalski, 32 4/10 |
Daudzveidības reitings (unikāls pilns vārds / kopā)
| Modelis | Daudzveidība | Top vārds | Top uzvārds | Mode collapse |
|---|---|---|---|---|
| gemini-3.1-pro | 70% | Tomasz (32%) | Wiśniewski (25%) | 🟢 zems |
| gpt-5.5 | 52% | Michał (57%) | Wysocki (40%) | 🟡 vidējs |
| claude-sonnet-4.6 | 48% | Katarzyna (20%) | Kowalczyk (22%) | 🟡 vidējs |
| grok-4-fast | 45% | Anna (28%) | Nowak (42%) | 🟡 vidējs |
| deepseek-chat | 35% | Jan (40%) | Kowalski (55%) | 🔴 augsts |
| claude-opus-4.7 | 32% | Katarzyna (75%) | Wiśniewska (50%) | 🔴 augsts |
Ko tas nozīmē TherapySupport
Praktiski secinājumi no pētījuma — kur LLM neobjektivitāte var ietekmēt terapeitisko darbu un kur ir vērts iejaukties.
Modeļa neobjektivitāte var ietekmēt klīnisko intuīciju
Kad modelis "iesaka" scenārijus, tas dara to sava arhetipa virzienā
Modeļi, ko izmanto piemēru gadījumu ģenerēšanai (gadījumu izpēte, apmācības maketi, mācību materiāli), sistemātiski nostiprina stereotipus. Klīnicists, kas izmanto LLM prāta vētrai, saņem ar neobjektivitāti filtrētu ideju sarakstu — piem., vienmēr sieviete ar trauksmi, vienmēr vīrietis ar NPD.
Netipiski pacienti kļūst neredzami
Vīrietis ar GAD, sieviete ar NPD — modeļi vienkārši viņus "neredz"
Ja modeļi ģenerē 100% vīriešu dzimuma NPD pacientu un 100% sieviešu dzimuma GAD pacientu (Opus, Grok), to "pacientu vārdnīca" izslēdz nedominējošā dzimuma reālos gadījumus. Tam ir nozīme ar AI atbalstītiem sesiju kopsavilkumiem, diagnostiskiem ieteikumiem vai automātisku tagošanu.
Modeļa izvēlei ir nozīme
Izglītības uzdevumiem dodiet priekšroku "daudzveidīgam" modelim, nevis "koncentrētam"
Ja mērķis ir piemēru daudzveidība (piem., apmācības materiāls, kas parāda pacientu plašo spektru) — izvēlieties Gemini 3.1 Pro vai Grok-4 Fast. Ja mērķis ir "mācību grāmatas" prototipa pacients (piem., gadījums UI testēšanai) — izvēlieties Claude Opus vai DeepSeek (spēcīgākā moda).
| Mērķis | Ieteicamais modelis | Kāpēc |
|---|---|---|
| Apmācības materiāls | Gemini 3.1 Pro · Grok-4 | Augstākā vārdu un vecuma daudzveidība |
| UI testēšana / mock dati | DeepSeek · Claude Opus | Stabili, "modāli" arhetipi |
| Pēc dzimuma sabalansētas kopas | Grok-4 Fast | 52% S / 48% V kopumā |
| Uz daudzveidību orientēti pētījumi | Apvienot 3+ modeļu rezultātus | Dažādas neobjektivitātes viena otru izlīdzsvaro |
Mazināšanas paņēmieni darbā ar LLM
Konkrēti uzvedņu veidošanas un validācijas paņēmieni, kas samazina neobjektivitāti
- Piespiediet demogrāfisku variāciju uzvednē: "Ģenerē 22 gadus vecu sievieti ar NPD" nevis atvērtu "ģenerē pacientu ar NPD".
- Izmantojiet sēklas / vairākus izsaukumus: ģenerējiet 5-10 kandidātus un izvēlieties nejauši, nevis ņemiet pirmo.
- Apvienojiet atbildes no vairākiem modeļiem: Gemini + Grok + DeepSeek kopums dod krietni plašāku sadalījumu nekā jebkurš atsevišķs modelis.
- Auditējiet rezultātu: reizi ceturksnī — ģenerējiet N=100 atbildes un pārbaudiet dzimuma, vecuma, uzvārdu sadalījumu. Modeļi mainās ar katru jaunu modeļa versiju.
Avota dati un replikācija
Visas 240 neapstrādātās atbildes ir pieejamas pēc pieprasījuma. Arī replikācijas skripti ir pieejami pēc pieprasījuma.
| Elements | Vērtība |
|---|---|
| Vaicājumu kopskaits | 240 (6 modeļi × 4 traucējumi × 10 atkārtojumi) |
| Temperatūra | 0,9 |
| Maks. marķieru (tokens) | 60 (200 GPT-5.5, 2000 Gemini 3.1) |
| Kā izsaukts | HTTPS POST uz OpenRouter API, paralēli (asyncio + httpx) |
| Vienlaicīgums | 20 (semafors) |
| Kopējais izpildes laiks | ~3 min 240 izsaukumiem |
| Valoda | Poļu (uzvedne un sagaidāmais rezultāts) |
| Dzimuma klasifikācija | Heiristika: vārds, kas beidzas ar "a" → sieviete, citādi → vīrietis (tipiski poļu valodai) |
Pētījuma ierobežojumi
- Maza izlase katrai šūnai: 10 atkārtojumi ir par maz stingrai statistiskai nozīmībai. Rezultāti apraksta tendenci, nevis pierādījumu.
- Dzimuma heiristika: klasifikācija pēc vārda galotnes ir nepilnīga (piem., "Kuba", "Bonifacy"). Praksē tā darbojas >95% poļu vārdiem.
- Tikai 4 traucējumi: pilnīgākam attēlam ir vērts paplašināt to ar BPD, ADHD, šizofrēniju, PTSS, autismu.
- Tikai poļu konteksts: neobjektivitāte var izskatīties ļoti citādi angļu, vācu vai spāņu pacientiem.
- Laika momentuzņēmums: rezultāti derīgi 2026. gada aprīļa modeļu versijām. Pēc modeļu atjauninājumiem modeļi var mainīties.
Lejupielādējiet neapstrādātos datus (19 KB)
Atstājiet e-pastu — mēs jums nosūtīsim ZIP: visas 240 LLM atbildes (results.json), apkopotos pārskatus (final_report.md, per_model_report.md) un Python skriptus eksperimenta atkārtošanai.
CC-BY 4.0 · Bez paywall · Bez pārdošanas turpinājuma.