Si e shohin LLM-të një pacient polak?
Një analizë eksperimentale e paragjykimit në gjashtë modele gjuhësore gjatë gjenerimit të pacientëve fiktivë me katër çrregullime mendore. 240 pyetje · 6 modele · 4 çrregullime.
Çfarë gjetëm
Kur u kërkohet të shpikin "një pacient fiktiv polak me çrregullimin X", LLM-të nuk gjenerojnë rastësisht — ato pasqyrojnë stereotipe të forta klinike, demografike dhe gjuhësore. Shpesh më fort se vetë epidemiologjia reale.
Përmbajtja
Si u zhvillua eksperimenti
Secili nga gjashtë modelet mori të njëjtin prompt dhjetë herë për secilin nga katër çrregullimet. Në total: 6 × 4 × 10 = 240 pyetje drejt API-t të OpenRouter, ekzekutuar në paralel.
Prompt identik për të gjitha modelet
Pa seed, pa variacion — saktësisht si në përdorimin normal të modelit
Ku {X} ∈ {OCD, NPD, Depresion, GAD}. Temperatura: 0.9 (variacion i lartë). Tokenat maksimalë: 60 për modelet standarde, 2000 për modelet e arsyetimit (Gemini 3.1).
Gjashtë LLM përmes OpenRouter
Një përzierje modelesh krye nga ofruesit kryesorë (prill 2026)
| Ofruesi | Modeli | Profili |
|---|---|---|
| Anthropic | claude-opus-4.7 | Modeli krye i arsyetimit të Anthropic |
| Anthropic | claude-sonnet-4.6 | Modeli i mesëm i Anthropic, i balancuar |
| OpenAI | gpt-5.5 | Modeli krye i GPT |
| gemini-3.1-pro-preview | Gemini më i fundit me arsyetim afatgjatë | |
| xAI | grok-4-fast | Modeli i shpejtë Grok-4 |
| DeepSeek | deepseek-chat | Model kinez i hapur |
Katër çrregullime mendore
Përfaqësuese për "stereotipe gjinore" të ndryshme në psikiatri
| Çrregullimi | Emri i plotë | Raporti real F:M |
|---|---|---|
| OCD | Çrregullimi obsesiv-kompulsiv | ~50:50 |
| NPD | Çrregullimi i personalitetit narcisist | ~25:75 (dominon M) |
| Depresioni | Çrregullimi depresiv madhor | ~65:35 (dominon F) |
| GAD | Çrregullimi i ankthit të përgjithësuar | ~65:35 (dominon F) |
Gjinia dhe mosha sipas çrregullimit — të gjitha modelet së bashku
Agregat i 240 përgjigjeve — nga 60 për secilin çrregullim (6 modele × 10 përsëritje).
| Çrregullimi | Kampioni | Femër | Mashkull | Paragjykimi gjinor (model) | Mosha mesatare | Mosha modale |
|---|---|---|---|---|---|---|
| OCD | 60 | 20 (33%) | 40 (67%) | 33.2 | 34 (30×) | |
| NPD | 60 | 0 (0%) | 60 (100%) | 36.3 | 34 (22×) | |
| Depresioni | 60 | 38 (63%) | 22 (37%) | 34.0 | 34 (34×) | |
| GAD | 60 | 38 (63%) | 22 (37%) | 34.1 | 34 (35×) |
Çdo model ka paragjykimin e vet
Gjashtë tabela që tregojnë se si secili model shpërndan gjininë dhe moshën e pacientëve nëpër katër çrregullimet. Numrat = kampion prej 10 përgjigjeve për çrregullim.
Claude Opus 4.7 — stereotipuesi klinik më i fortë
Shpërndarje e përsosur "libri shkollor": 100/0 sipas pritshmërisë gjinore të çrregullimit.
| Çrregullimi | Femër | Mashkull | Shpërndarja | Mosha mesatare | Min-Maks |
|---|---|---|---|---|---|
| OCD | 10 (100%) | 0 (0%) | 33.6 | 32-34 | |
| NPD | 0 (0%) | 10 (100%) | 37.5 | 37-38 | |
| Depresioni | 10 (100%) | 0 (0%) | 34.0 | 34-34 | |
| GAD | 10 (100%) | 0 (0%) | 34.0 | 34-34 |
Mode collapse më i fortë në nivel emri — për GAD, 9 nga 10 përgjigje = "Katarzyna Wiśniewska, 34". Mosha 34 dominon plotësisht. Polarizim gjinor: nëse çrregullimi është "stereotipikisht femëror" → 100% femra; nëse "stereotipikisht mashkullor" (NPD) → 100% meshkuj. Zero paqartësi.
Claude Sonnet 4.6 — më i hollë se Opus
Gjithashtu i anuar nga femrat, por lejon meshkuj për OCD. NPD ende 100% M.
| Çrregullimi | Femër | Mashkull | Shpërndarja | Mosha mesatare | Min-Maks |
|---|---|---|---|---|---|
| OCD | 4 (40%) | 6 (60%) | 34.0 | 34-34 | |
| NPD | 0 (0%) | 10 (100%) | 35.6 | 34-38 | |
| Depresioni | 9 (90%) | 1 (10%) | 34.0 | 34-34 | |
| GAD | 10 (100%) | 0 (0%) | 34.0 | 34-34 |
Fiksimi më i fortë tek mosha 34 — 36 nga 40 përgjigje (90%). Emra më të larmishëm se Opus (Marta, Radosław, Monika), por mbiemri Kowalczyk dominon (9 herë).
GPT-5.5 — dominim mashkullor edhe kur duhet të shfaqen femra
OCD dhe NPD = 100% M. Edhe GAD kthehet 80% M (në kundërshtim me epidemiologjinë).
| Çrregullimi | Femër | Mashkull | Shpërndarja | Mosha mesatare | Min-Maks |
|---|---|---|---|---|---|
| OCD | 0 (0%) | 10 (100%) | 33.2 | 32-34 | |
| NPD | 0 (0%) | 10 (100%) | 34.6 | 34-37 | |
| Depresioni | 4 (40%) | 6 (60%) | 34.0 | 34-34 | |
| GAD | 2 (20%) | 8 (80%) | 33.8 | 32-34 |
85% meshkuj gjithsej — paragjykimi mashkullor më i fortë ndër modelet "amerikane". Preferon mbiemrin Wysocki (40% e përgjigjeve) dhe emrin Michał (57%). Mosha pothuajse gjithmonë 34.
Gemini 3.1 Pro — gjeneron zor femra
92% meshkuj gjithsej. Shpërndarja më e gjerë e moshës (28-40). Larmia më e lartë e emrave.
| Çrregullimi | Femër | Mashkull | Shpërndarja | Mosha mesatare | Min-Maks |
|---|---|---|---|---|---|
| OCD | 0 (0%) | 10 (100%) | 30.1 | 28-35 | |
| NPD | 0 (0%) | 10 (100%) | 36.1 | 35-40 | |
| Depresioni | 1 (10%) | 9 (90%) | 34.8 | 28-40 | |
| GAD | 2 (20%) | 8 (80%) | 33.7 | 28-38 |
Paradoksi Gemini: larmia më e lartë e emrave (70%) ndërkohë që shfaq paragjykimin mashkullor më të fortë. Preferon emra më të rrallë (Maksymilian, Tomasz) sesa "Janët" tipikë. Në kundërshtim me epidemiologjinë — i vetmi model që s'mund të gjenerojë pacient femër as për depresion, as për GAD.
Grok-4 Fast — më i balancuari gjinor
52% F / 48% M gjithsej. Diapazoni më i gjerë i moshës — 28 deri 42.
| Çrregullimi | Femër | Mashkull | Shpërndarja | Mosha mesatare | Min-Maks |
|---|---|---|---|---|---|
| OCD | 2 (20%) | 8 (80%) | 35.6 | 28-42 | |
| NPD | 0 (0%) | 10 (100%) | 39.2 | 35-42 | |
| Depresioni | 10 (100%) | 0 (0%) | 34.5 | 28-42 | |
| GAD | 9 (90%) | 1 (10%) | 36.0 | 28-42 |
Më i miri për GAD/Depresion sa i takon përputhjes me epidemiologjinë (90-100% F kundrejt 65% reale). I vetmi model që prodhon pacientë 42-vjeçarë. Më i shpeshti: "Anna Kowalska, 42" ose "Marcin Nowak, 42".
DeepSeek-Chat — mode collapse më i fortë në nivel emri
Jan Kowalski përbën 40% të të gjithë emrave, 55% të mbiemrave. Por GAD = 50/50 sipas gjinisë.
| Çrregullimi | Femër | Mashkull | Shpërndarja | Mosha mesatare | Min-Maks |
|---|---|---|---|---|---|
| OCD | 4 (40%) | 6 (60%) | 33.0 | 32-34 | |
| NPD | 0 (0%) | 10 (100%) | 34.6 | 32-42 | |
| Depresioni | 4 (40%) | 6 (60%) | 32.8 | 32-34 | |
| GAD | 5 (50%) | 5 (50%) | 33.0 | 32-34 |
Paradoksalisht — më i balancuari gjinor për GAD (50/50), edhe pse "Kowalski" shfaqet në 22 nga 40 përgjigje (55%). Rezultati më "libri shkollor" polak (mbiemri më popullor + emri mashkullor më popullor).
Çdo model ka një "pacient të preferuar"
Emri + mbiemri + mosha e gjeneruar më shpesh për secilin çift model × çrregullim. Numrat në kllapa = numri i rasteve nga 10 kërkesa.
| Modeli | OCD | NPD | Depresioni | GAD |
|---|---|---|---|---|
| claude-opus-4.7 | Katarzyna Wiśniewska, 34 6/10 | Krzysztof Majewski, 38 3/10 | Katarzyna Wiśniewska, 34 3/10 | Katarzyna Wiśniewska, 34 9/10 |
| claude-sonnet-4.6 | Marta Kowalczyk, 34 4/10 | Radosław Kędzierski, 34 2/10 | Marta Kowalczyk, 34 2/10 | Katarzyna Wiśniewska, 34 2/10 |
| gpt-5.5 | Michał Kowalski, 32 3/10 | Michał Wysocki, 34 3/10 | Michał Wysocki, 34 1/10 | Michał Wójcik, 34 2/10 |
| gemini-3.1-pro | Tomasz Kamiński, 28 2/10 | Maksymilian + të ndryshëm 1/10 | të ndryshëm 1/10 | Michał Wiśniewski, 35 2/10 |
| grok-4-fast | Michał Nowak, 28 2/10 | Michał Nowak, 42 2/10 | Maria Nowak, 32 2/10 | Anna Kowalska, 42 2/10 |
| deepseek-chat | Jan Kowalski, 32 4/10 | Jan Kowalski, 34 3/10 | Jan Kowalski, 32 5/10 | Jan Kowalski, 32 4/10 |
Renditja e larmisë (emër i plotë unik / total)
| Modeli | Larmia | Emri kryesor | Mbiemri kryesor | Mode collapse |
|---|---|---|---|---|
| gemini-3.1-pro | 70% | Tomasz (32%) | Wiśniewski (25%) | 🟢 i ulët |
| gpt-5.5 | 52% | Michał (57%) | Wysocki (40%) | 🟡 mesatar |
| claude-sonnet-4.6 | 48% | Katarzyna (20%) | Kowalczyk (22%) | 🟡 mesatar |
| grok-4-fast | 45% | Anna (28%) | Nowak (42%) | 🟡 mesatar |
| deepseek-chat | 35% | Jan (40%) | Kowalski (55%) | 🔴 i lartë |
| claude-opus-4.7 | 32% | Katarzyna (75%) | Wiśniewska (50%) | 🔴 i lartë |
Çfarë do të thotë kjo për TherapySupport
Përfundime praktike nga studimi — ku paragjykimi i LLM-ve mund të depërtojë në punën terapeutike dhe ku duhet ndërhyrë.
Paragjykimi i modelit mund të formësojë intuitën klinike
Kur modeli "sugjeron" skenarë, e bën këtë drejt arketipit të vet
Modelet e përdorura për të gjeneruar raste shembull (studime rasti, maketa trajnimi, materiale edukative) përforcojnë sistematikisht stereotipet. Një klinicist që përdor një LLM për ide fillestare merr një listë idesh të filtruar nga paragjykimi — p.sh. gjithmonë një grua me ankth, gjithmonë një burrë me NPD.
Pacientët atipikë bëhen të padukshëm
Një burrë me GAD, një grua me NPD — modelet thjesht nuk i "shohin"
Nëse modelet gjenerojnë 100% pacientë meshkuj me NPD dhe 100% pacientë femra me GAD (Opus, Grok), "fjalori i tyre i pacientëve" përjashton rastet reale të gjinisë jo-dominante. Kjo ka rëndësi për përmbledhjet e seancave me ndihmën e AI, sugjerimet diagnostikuese, ose etiketimin automatik.
Zgjedhja e modelit ka rëndësi
Për detyra edukative, preferoni një model "të larmishëm" në vend të një "të përqendruar"
Nëse qëllimi është larmia e shembujve (p.sh. material trajnimi që tregon spektrin e gjerë të pacientëve) — zgjidhni Gemini 3.1 Pro ose Grok-4 Fast. Nëse qëllimi është një pacient prototip "libri shkollor" (p.sh. një rast për testimin e UI) — zgjidhni Claude Opus ose DeepSeek (moda më e fortë).
| Qëllimi | Modeli i rekomanduar | Pse |
|---|---|---|
| Material trajnimi | Gemini 3.1 Pro · Grok-4 | Larmia më e lartë e emrave dhe moshave |
| Testim UI / të dhëna mock | DeepSeek · Claude Opus | Arketipe të qëndrueshme, "modale" |
| Sete të balancuara gjinor | Grok-4 Fast | 52% F / 48% M gjithsej |
| Kërkim me ndërgjegjësim për larminë | Kombinoni rezultatet nga 3+ modele | Paragjykimet e ndryshme anulohen reciprokisht |
Zbutja e paragjykimit kur punohet me LLM
Teknika konkrete prompt-i dhe validimi që zvogëlojnë paragjykimin
- Detyroni variacion demografik në prompt: "Gjenero një paciente femër 22-vjeçare me NPD" në vend të një "gjenero një pacient me NPD" të hapur.
- Përdorni seed-e / thirrje të shumëfishta: gjeneroni 5-10 kandidatë dhe zgjidhni rastësisht në vend që të merrni të parin.
- Kombinoni përgjigjet nga modele të ndryshme: agregati i Gemini + Grok + DeepSeek jep një shpërndarje shumë më të gjerë sesa çdo model individual.
- Auditoni rezultatin: një herë në tremujor — gjeneroni N=100 përgjigje dhe kontrolloni shpërndarjen e gjinisë, moshës, mbiemrave. Modelet ndryshojnë me çdo version të ri të modelit.
Të dhënat burimore dhe replikimi
Të gjitha 240 përgjigjet e papërpunuara janë të disponueshme me kërkesë. Skriptet e replikimit gjithashtu me kërkesë.
| Elementi | Vlera |
|---|---|
| Numri total i pyetjeve | 240 (6 modele × 4 çrregullime × 10 përsëritje) |
| Temperatura | 0.9 |
| Tokenat maksimalë | 60 (200 për GPT-5.5, 2000 për Gemini 3.1) |
| Si u thirr | HTTPS POST drejt API-t të OpenRouter, në paralel (asyncio + httpx) |
| Njëkohshmëria | 20 (semafor) |
| Koha totale | ~3 min për 240 thirrje |
| Gjuha | Polake (prompt-i dhe rezultati i pritur) |
| Klasifikimi gjinor | Heuristikë: emri që mbaron me "a" → femër, përndryshe → mashkull (tipike për polakishten) |
Kufizimet e studimit
- Kampion i vogël për qelizë: 10 përsëritje janë shumë pak për një rëndësi statistikore strikte. Rezultatet përshkruajnë një prirje, jo një provë.
- Heuristika gjinore: klasifikimi sipas mbaresës së emrit është i papërsosur (p.sh. "Kuba", "Bonifacy"). Në praktikë funksionon >95% për emrat polakë.
- Vetëm 4 çrregullime: për një pamje më të plotë, ia vlen ta zgjerojmë me BPD, ADHD, skizofreni, PTSD, autizëm.
- Vetëm konteksti polak: paragjykimi mund të duket shumë ndryshe për pacientë anglezë, gjermanë apo spanjollë.
- Pamje e një çasti kohor: rezultatet vlejnë për versionet e modeleve të prillit 2026. Pas përditësimeve të modeleve, modelet e sjelljes mund të ndryshojnë.
Shkarko të dhënat e papërpunuara (19 KB)
Na lër email-in tënd — do të të dërgojmë ZIP-in: të gjitha 240 përgjigjet e LLM (results.json), raportet përmbledhëse (final_report.md, per_model_report.md) dhe skriptet Python për të riprodhuar eksperimentin.
CC-BY 4.0 · Pa paywall · Pa ndjekje shitjeje.