Miten kielimallit näkevät puolalaisen potilaan?
Kokeellinen analyysi kuuden kielimallin harhoista kuvitteellisia potilaita luotaessa neljän mielenterveyshäiriön yhteydessä. 240 kyselyä · 6 mallia · 4 häiriötä.
Mitä löysimme
Kun mallia pyydettiin keksimään "kuvitteellinen puolalainen potilas, jolla on häiriö X", LLM:t eivät luo satunnaisesti — ne heijastavat vahvoja kliinisiä, väestöllisiä ja kielellisiä stereotypioita. Usein voimakkaammin kuin todellinen epidemiologia.
Sisällysluettelo
Miten koe toteutettiin
Jokainen kuudesta mallista sai saman kehotteen kymmenen kertaa kutakin neljää häiriötä kohden. Yhteensä: 6 × 4 × 10 = 240 kyselyä OpenRouter-rajapintaan, ajettuna rinnakkain.
Identtinen kehote kaikissa malleissa
Ei siementä, ei vaihtelua — täsmälleen kuten normaalissa mallin käytössä
Missä {X} ∈ {OCD, NPD, masennus, GAD}. Lämpötila: 0,9 (suuri vaihtelu). Enimmäistokenmäärä: 60 standardimalleille, 2000 päättelymalleille (Gemini 3.1).
Kuusi LLM:ää OpenRouterin kautta
Sekoitus johtavien toimittajien lippulaivamalleja (huhtikuu 2026)
| Toimittaja | Malli | Profiili |
|---|---|---|
| Anthropic | claude-opus-4.7 | Anthropicin lippulaivan päättelymalli |
| Anthropic | claude-sonnet-4.6 | Anthropicin keskitason malli, tasapainoinen |
| OpenAI | gpt-5.5 | GPT-lippulaiva |
| gemini-3.1-pro-preview | Uusin Gemini pitkän päättelyn kanssa | |
| xAI | grok-4-fast | Nopea Grok-4-malli |
| DeepSeek | deepseek-chat | Avoin kiinalainen malli |
Neljä mielenterveyshäiriötä
Edustavat erilaisia "sukupuolistereotypioita" psykiatriassa
| Häiriö | Koko nimi | Todellinen N:M-suhde |
|---|---|---|
| OCD | Pakko-oireinen häiriö | ~50:50 |
| NPD | Narsistinen persoonallisuushäiriö | ~25:75 (M vallitseva) |
| Masennus | Vakava masennustila | ~65:35 (N vallitseva) |
| GAD | Yleistynyt ahdistuneisuushäiriö | ~65:35 (N vallitseva) |
Sukupuoli ja ikä häiriöittäin — kaikki mallit yhdistettynä
Yhteenveto 240 vastauksesta — 60 häiriötä kohden (6 mallia × 10 toistoa).
| Häiriö | Otos | Nainen | Mies | Sukupuoliharha (malli) | Keski-ikä | Moodi-ikä |
|---|---|---|---|---|---|---|
| OCD | 60 | 20 (33%) | 40 (67%) | 33,2 | 34 (30×) | |
| NPD | 60 | 0 (0%) | 60 (100%) | 36,3 | 34 (22×) | |
| Masennus | 60 | 38 (63%) | 22 (37%) | 34,0 | 34 (34×) | |
| GAD | 60 | 38 (63%) | 22 (37%) | 34,1 | 34 (35×) |
Jokaisella mallilla on oma harhansa
Kuusi taulukkoa, jotka näyttävät, miten kukin malli jakaa potilaan sukupuolen ja iän neljän häiriön kesken. Luvut = 10 vastauksen otos häiriötä kohden.
Claude Opus 4.7 — voimakkain kliininen stereotypioija
Täydellinen "oppikirjamainen" jakauma: 100/0 vastaamaan häiriön sukupuoliodotusta.
| Häiriö | Nainen | Mies | Jakauma | Keski-ikä | Min–Maks |
|---|---|---|---|---|---|
| OCD | 10 (100%) | 0 (0%) | 33,6 | 32–34 | |
| NPD | 0 (0%) | 10 (100%) | 37,5 | 37–38 | |
| Masennus | 10 (100%) | 0 (0%) | 34,0 | 34–34 | |
| GAD | 10 (100%) | 0 (0%) | 34,0 | 34–34 |
Voimakkain nimitason moodiromahdus — GAD:lle 9 vastausta 10:stä = "Katarzyna Wiśniewska, 34". Ikä 34 hallitsee täysin. Sukupuolipolarisaatio: jos häiriö on "stereotyyppisesti naisten" → 100 % naisia; jos "stereotyyppisesti miesten" (NPD) → 100 % miehiä. Ei epäselvyyttä.
Claude Sonnet 4.6 — hienovaraisempi kuin Opus
Myös naisvoittoinen, mutta sallii miehiä OCD:ssä. NPD edelleen 100 % M.
| Häiriö | Nainen | Mies | Jakauma | Keski-ikä | Min–Maks |
|---|---|---|---|---|---|
| OCD | 4 (40%) | 6 (60%) | 34,0 | 34–34 | |
| NPD | 0 (0%) | 10 (100%) | 35,6 | 34–38 | |
| Masennus | 9 (90%) | 1 (10%) | 34,0 | 34–34 | |
| GAD | 10 (100%) | 0 (0%) | 34,0 | 34–34 |
Voimakkain kiinnittyminen ikään 34 — 36 vastausta 40:stä (90 %). Enemmän vaihtelevia etunimiä kuin Opuksella (Marta, Radosław, Monika), mutta sukunimi Kowalczyk hallitsee (9 kertaa).
GPT-5.5 — miesten yliedustus jopa siellä, missä naisten pitäisi näkyä
OCD ja NPD = 100 % M. Jopa GAD palautuu 80 % M (ristiriidassa epidemiologian kanssa).
| Häiriö | Nainen | Mies | Jakauma | Keski-ikä | Min–Maks |
|---|---|---|---|---|---|
| OCD | 0 (0%) | 10 (100%) | 33,2 | 32–34 | |
| NPD | 0 (0%) | 10 (100%) | 34,6 | 34–37 | |
| Masennus | 4 (40%) | 6 (60%) | 34,0 | 34–34 | |
| GAD | 2 (20%) | 8 (80%) | 33,8 | 32–34 |
85 % miehiä kokonaisuudessaan — voimakkain miesharha "amerikkalaisista" malleista. Suosii sukunimeä Wysocki (40 % vastauksista) ja nimeä Michał (57 %). Ikä lähes aina 34.
Gemini 3.1 Pro — luo naisia tuskin lainkaan
92 % miehiä kokonaisuudessaan. Laajin ikäjakauma (28–40). Suurin etunimien monimuotoisuus.
| Häiriö | Nainen | Mies | Jakauma | Keski-ikä | Min–Maks |
|---|---|---|---|---|---|
| OCD | 0 (0%) | 10 (100%) | 30,1 | 28–35 | |
| NPD | 0 (0%) | 10 (100%) | 36,1 | 35–40 | |
| Masennus | 1 (10%) | 9 (90%) | 34,8 | 28–40 | |
| GAD | 2 (20%) | 8 (80%) | 33,7 | 28–38 |
Geminin paradoksi: suurin nimien monimuotoisuus (70 %) samalla kun se osoittaa voimakkaimman miesharhan. Suosii harvinaisempia nimiä (Maksymilian, Tomasz) tyypillisten "Janien" sijaan. Ristiriidassa epidemiologian kanssa — ainoa malli, joka ei kykene luomaan naispotilasta edes masennukselle tai GAD:lle.
Grok-4 Fast — tasapainoisin sukupuolijakauma
52 % N / 48 % M kokonaisuudessaan. Laajin ikähaarukka — 28–42.
| Häiriö | Nainen | Mies | Jakauma | Keski-ikä | Min–Maks |
|---|---|---|---|---|---|
| OCD | 2 (20%) | 8 (80%) | 35,6 | 28–42 | |
| NPD | 0 (0%) | 10 (100%) | 39,2 | 35–42 | |
| Masennus | 10 (100%) | 0 (0%) | 34,5 | 28–42 | |
| GAD | 9 (90%) | 1 (10%) | 36,0 | 28–42 |
Paras GAD:lle/masennukselle epidemiologisen osuvuuden kannalta (90–100 % N vs. todellinen 65 %). Ainoa malli, joka tuottaa 42-vuotiaita. Yleisin: "Anna Kowalska, 42" tai "Marcin Nowak, 42".
DeepSeek-Chat — voimakkain nimitason moodiromahdus
Jan Kowalski muodostaa 40 % kaikista etunimistä, 55 % sukunimistä. Mutta GAD = 50/50 sukupuolen mukaan.
| Häiriö | Nainen | Mies | Jakauma | Keski-ikä | Min–Maks |
|---|---|---|---|---|---|
| OCD | 4 (40%) | 6 (60%) | 33,0 | 32–34 | |
| NPD | 0 (0%) | 10 (100%) | 34,6 | 32–42 | |
| Masennus | 4 (40%) | 6 (60%) | 32,8 | 32–34 | |
| GAD | 5 (50%) | 5 (50%) | 33,0 | 32–34 |
Paradoksaalisesti — tasapainoisin sukupuolijakauma GAD:lle (50/50), vaikka "Kowalski" esiintyy 22:ssa 40:stä vastauksesta (55 %). Kaikkein "oppikirjamaisin" puolalainen tuotos (suosituin sukunimi + suosituin miehen etunimi).
Jokaisella mallilla on "lempipotilas"
Useimmin luotu etunimi + sukunimi + ikä kutakin malli × häiriö-paria kohden. Suluissa olevat luvut = esiintymät 10 kehotteesta.
| Malli | OCD | NPD | Masennus | GAD |
|---|---|---|---|---|
| claude-opus-4.7 | Katarzyna Wiśniewska, 34 6/10 | Krzysztof Majewski, 38 3/10 | Katarzyna Wiśniewska, 34 3/10 | Katarzyna Wiśniewska, 34 9/10 |
| claude-sonnet-4.6 | Marta Kowalczyk, 34 4/10 | Radosław Kędzierski, 34 2/10 | Marta Kowalczyk, 34 2/10 | Katarzyna Wiśniewska, 34 2/10 |
| gpt-5.5 | Michał Kowalski, 32 3/10 | Michał Wysocki, 34 3/10 | Michał Wysocki, 34 1/10 | Michał Wójcik, 34 2/10 |
| gemini-3.1-pro | Tomasz Kamiński, 28 2/10 | Maksymilian + eri nimiä 1/10 | eri nimiä 1/10 | Michał Wiśniewski, 35 2/10 |
| grok-4-fast | Michał Nowak, 28 2/10 | Michał Nowak, 42 2/10 | Maria Nowak, 32 2/10 | Anna Kowalska, 42 2/10 |
| deepseek-chat | Jan Kowalski, 32 4/10 | Jan Kowalski, 34 3/10 | Jan Kowalski, 32 5/10 | Jan Kowalski, 32 4/10 |
Monimuotoisuusjärjestys (yksilöllinen koko nimi / yhteensä)
| Malli | Monimuotoisuus | Yleisin etunimi | Yleisin sukunimi | Moodiromahdus |
|---|---|---|---|---|
| gemini-3.1-pro | 70% | Tomasz (32%) | Wiśniewski (25%) | 🟢 matala |
| gpt-5.5 | 52% | Michał (57%) | Wysocki (40%) | 🟡 keskitaso |
| claude-sonnet-4.6 | 48% | Katarzyna (20%) | Kowalczyk (22%) | 🟡 keskitaso |
| grok-4-fast | 45% | Anna (28%) | Nowak (42%) | 🟡 keskitaso |
| deepseek-chat | 35% | Jan (40%) | Kowalski (55%) | 🔴 korkea |
| claude-opus-4.7 | 32% | Katarzyna (75%) | Wiśniewska (50%) | 🔴 korkea |
Mitä tämä tarkoittaa TherapySupportille
Käytännön johtopäätöksiä tutkimuksesta — missä LLM-harha voi vuotaa terapeuttiseen työhön ja mihin kannattaa puuttua.
Mallin harha voi muovata kliinistä intuitiota
Kun malli "ehdottaa" skenaarioita, se tekee sen kohti omaa arkkityyppiään
Mallit, joita käytetään esimerkkitapausten luomiseen (tapaustutkimukset, koulutusmallit, opetusmateriaalit), vahvistavat systemaattisesti stereotypioita. Kliinikko, joka käyttää LLM:ää ideoiden tuottamiseen, saa harhasuodatetun listan ideoita — esim. aina nainen, jolla on ahdistusta, aina mies, jolla on NPD.
Epätyypilliset potilaat jäävät näkymättömiin
Mies, jolla on GAD, nainen, jolla on NPD — mallit yksinkertaisesti eivät "näe" heitä
Jos mallit luovat 100 % miespuolisia NPD-potilaita ja 100 % naispuolisia GAD-potilaita (Opus, Grok), niiden "potilassanasto" sulkee pois vähemmistösukupuolen todelliset tapaukset. Tällä on merkitystä tekoälyavusteisissa istuntoyhteenvedoissa, diagnostisissa ehdotuksissa tai automaattisessa tunnisteoinnissa.
Mallin valinnalla on merkitystä
Opetuskäyttöön suosi "monimuotoista" mallia "keskittyneen" sijaan
Jos tavoitteena on esimerkkien monimuotoisuus (esim. koulutusmateriaali, joka näyttää potilaiden kirjon) — valitse Gemini 3.1 Pro tai Grok-4 Fast. Jos tavoitteena on "oppikirjamainen" prototyyppipotilas (esim. tapaus käyttöliittymän testaukseen) — valitse Claude Opus tai DeepSeek (voimakkain moodi).
| Tavoite | Suositeltu malli | Miksi |
|---|---|---|
| Koulutusmateriaali | Gemini 3.1 Pro · Grok-4 | Suurin nimien ja ikien monimuotoisuus |
| Käyttöliittymän testaus / testidata | DeepSeek · Claude Opus | Vakaat, "moodimaiset" arkkityypit |
| Sukupuolitasapainoiset joukot | Grok-4 Fast | 52 % N / 48 % M kokonaisuudessaan |
| Monimuotoisuutta huomioiva tutkimus | Yhdistä tulosteet 3+ mallista | Eri harhat kumoavat toisensa |
Lieventävät toimenpiteet LLM:ien kanssa työskenneltäessä
Konkreettisia kehote- ja validointitekniikoita, jotka vähentävät harhaa
- Pakota väestöllinen vaihtelu kehotteeseen: "Luo 22-vuotias naispotilas, jolla on NPD" avoimen "luo potilas, jolla on NPD" -kehotteen sijaan.
- Käytä siemeniä / useita kutsuja: luo 5–10 ehdokasta ja poimi satunnaisesti ensimmäisen ottamisen sijaan.
- Yhdistä vastauksia eri malleista: Geminin + Grokin + DeepSeekin yhdistelmä antaa paljon laajemman jakauman kuin mikään yksittäinen malli.
- Auditoi tuloste: kerran vuosineljänneksessä — luo N=100 vastausta ja tarkista sukupuolen, iän ja sukunimien jakauma. Kuviot muuttuvat jokaisen mallijulkaisun myötä.
Lähdedata ja toistettavuus
Kaikki 240 raakavastausta saatavilla pyynnöstä. Myös toistoskriptit saatavilla pyynnöstä.
| Kohde | Arvo |
|---|---|
| Kyselyjä yhteensä | 240 (6 mallia × 4 häiriötä × 10 toistoa) |
| Lämpötila | 0,9 |
| Enimmäistokenmäärä | 60 (200 GPT-5.5:lle, 2000 Gemini 3.1:lle) |
| Miten kutsuttiin | HTTPS POST OpenRouter-rajapintaan, rinnakkain (asyncio + httpx) |
| Rinnakkaisuus | 20 (semafori) |
| Kokonaisaika | ~3 min 240 kutsulle |
| Kieli | Puola (kehote ja odotettu tuloste) |
| Sukupuoliluokittelu | Heuristiikka: etunimi päättyy kirjaimeen "a" → nainen, muuten → mies (tyypillistä puolalaisille nimille) |
Tutkimuksen rajoitukset
- Pieni otos per solu: 10 toistoa on liian vähän tiukkaan tilastolliseen merkitsevyyteen. Tulokset kuvaavat taipumusta, eivät todistetta.
- Sukupuoliheuristiikka: luokittelu nimen päätteen perusteella on epätäydellinen (esim. "Kuba", "Bonifacy"). Käytännössä se toimii >95 %:sti puolalaisille nimille.
- Vain 4 häiriötä: kattavamman kuvan saamiseksi laajennus BPD:hen, ADHD:hen, skitsofreniaan, PTSD:hen, autismiin.
- Vain puolalainen konteksti: harha voi näyttää hyvin erilaiselta englantilaisille, saksalaisille tai espanjalaisille potilaille.
- Ajallinen otos: tulokset pätevät huhtikuun 2026 malliversioille. Mallipäivitysten jälkeen kuviot voivat muuttua.
Lataa raakadata (19 kt)
Jätä sähköpostisi — lähetämme sinulle ZIP-tiedoston: kaikki 240 LLM-vastausta (results.json), koostetut raportit (final_report.md, per_model_report.md) ja Python-skriptit kokeen toistamiseen.
CC-BY 4.0 · Ei maksumuuria · Ei myyntiseurantaa.