Hoe zien LLM's een Poolse patiënt?
Een experimentele analyse van bias in zes taalmodellen bij het genereren van fictieve patiënten met vier psychische stoornissen. 240 query's · 6 modellen · 4 stoornissen.
Wat we ontdekten
Wanneer je LLM's vraagt om "een fictieve Poolse patiënt met stoornis X" te bedenken, genereren ze niet willekeurig — ze weerspiegelen sterke klinische, demografische en linguïstische stereotypen. Vaak nog sterker dan de reële epidemiologie.
Inhoudsopgave
Hoe het experiment werd uitgevoerd
Elk van de zes modellen kreeg dezelfde prompt tien keer voor elk van de vier stoornissen. In totaal: 6 × 4 × 10 = 240 query's naar de OpenRouter API, parallel uitgevoerd.
Identieke prompt voor alle modellen
Geen seed, geen variatie — precies zoals bij normaal modelgebruik
Waarbij {X} ∈ {OCD, NPD, Depressie, GAD}. Temperatuur: 0.9 (hoge variatie). Max tokens: 60 voor standaardmodellen, 2000 voor redenerende modellen (Gemini 3.1).
Zes LLM's via OpenRouter
Een mix van vlaggenschipmodellen van toonaangevende aanbieders (april 2026)
| Aanbieder | Model | Profiel |
|---|---|---|
| Anthropic | claude-opus-4.7 | Vlaggenschip redenerend model van Anthropic |
| Anthropic | claude-sonnet-4.6 | Middensegment van Anthropic, gebalanceerd |
| OpenAI | gpt-5.5 | Vlaggenschip GPT |
| gemini-3.1-pro-preview | Nieuwste Gemini met langdurig redeneren | |
| xAI | grok-4-fast | Snel Grok-4-model |
| DeepSeek | deepseek-chat | Open Chinees model |
Vier psychische stoornissen
Representatief voor verschillende "gendersstereotypen" in de psychiatrie
| Stoornis | Volledige naam | Reële verhouding V:M |
|---|---|---|
| OCD | Obsessieve-compulsieve stoornis | ~50:50 |
| NPD | Narcistische persoonlijkheidsstoornis | ~25:75 (M dominant) |
| Depressie | Depressieve stoornis | ~65:35 (V dominant) |
| GAD | Gegeneraliseerde angststoornis | ~65:35 (V dominant) |
Geslacht en leeftijd per stoornis — alle modellen samen
Optelling van 240 reacties — 60 per stoornis (6 modellen × 10 herhalingen).
| Stoornis | Steekproef | Vrouw | Man | Genderbias (model) | Gemiddelde leeftijd | Modale leeftijd |
|---|---|---|---|---|---|---|
| OCD | 60 | 20 (33%) | 40 (67%) | 33.2 | 34 (30×) | |
| NPD | 60 | 0 (0%) | 60 (100%) | 36.3 | 34 (22×) | |
| Depressie | 60 | 38 (63%) | 22 (37%) | 34.0 | 34 (34×) | |
| GAD | 60 | 38 (63%) | 22 (37%) | 34.1 | 34 (35×) |
Elk model heeft zijn eigen bias
Zes tabellen die laten zien hoe elk model geslacht en leeftijd van patiënten verdeelt over de vier stoornissen. Cijfers = steekproef van 10 reacties per stoornis.
Claude Opus 4.7 — de sterkste klinische stereotypeerder
Perfecte "leerboek"-verdeling: 100/0 in overeenstemming met de genderverwachting van de stoornis.
| Stoornis | Vrouw | Man | Verdeling | Gemiddelde leeftijd | Min-Max |
|---|---|---|---|---|---|
| OCD | 10 (100%) | 0 (0%) | 33.6 | 32-34 | |
| NPD | 0 (0%) | 10 (100%) | 37.5 | 37-38 | |
| Depressie | 10 (100%) | 0 (0%) | 34.0 | 34-34 | |
| GAD | 10 (100%) | 0 (0%) | 34.0 | 34-34 |
Sterkste naam-niveau mode collapse — bij GAD is 9 van de 10 reacties = "Katarzyna Wiśniewska, 34". Leeftijd 34 domineert volkomen. Genderpolarisatie: als de stoornis "stereotiep vrouwelijk" is → 100% vrouw; als "stereotiep mannelijk" (NPD) → 100% man. Geen enkele dubbelzinnigheid.
Claude Sonnet 4.6 — subtieler dan Opus
Ook vrouwgericht, maar staat mannen toe bij OCD. NPD nog steeds 100% M.
| Stoornis | Vrouw | Man | Verdeling | Gemiddelde leeftijd | Min-Max |
|---|---|---|---|---|---|
| OCD | 4 (40%) | 6 (60%) | 34.0 | 34-34 | |
| NPD | 0 (0%) | 10 (100%) | 35.6 | 34-38 | |
| Depressie | 9 (90%) | 1 (10%) | 34.0 | 34-34 | |
| GAD | 10 (100%) | 0 (0%) | 34.0 | 34-34 |
Sterkste fixatie op leeftijd 34 — 36 van de 40 reacties (90%). Meer gevarieerde voornamen dan Opus (Marta, Radosław, Monika), maar de achternaam Kowalczyk domineert (9 keer).
GPT-5.5 — mannelijke dominantie zelfs waar vrouwen zouden moeten verschijnen
OCD en NPD = 100% M. Zelfs GAD komt terug op 80% M (in tegenspraak met epidemiologie).
| Stoornis | Vrouw | Man | Verdeling | Gemiddelde leeftijd | Min-Max |
|---|---|---|---|---|---|
| OCD | 0 (0%) | 10 (100%) | 33.2 | 32-34 | |
| NPD | 0 (0%) | 10 (100%) | 34.6 | 34-37 | |
| Depressie | 4 (40%) | 6 (60%) | 34.0 | 34-34 | |
| GAD | 2 (20%) | 8 (80%) | 33.8 | 32-34 |
85% man in totaal — de sterkste mannelijke bias van de "Amerikaanse" modellen. Houdt van de achternaam Wysocki (40% van de reacties) en de naam Michał (57%). Leeftijd bijna altijd 34.
Gemini 3.1 Pro — genereert nauwelijks vrouwen
92% man in totaal. Breedste leeftijdsverdeling (28-40). Hoogste diversiteit aan voornamen.
| Stoornis | Vrouw | Man | Verdeling | Gemiddelde leeftijd | Min-Max |
|---|---|---|---|---|---|
| OCD | 0 (0%) | 10 (100%) | 30.1 | 28-35 | |
| NPD | 0 (0%) | 10 (100%) | 36.1 | 35-40 | |
| Depressie | 1 (10%) | 9 (90%) | 34.8 | 28-40 | |
| GAD | 2 (20%) | 8 (80%) | 33.7 | 28-38 |
De Gemini-paradox: hoogste diversiteit aan namen (70%) terwijl het tegelijkertijd de sterkste mannelijke bias vertoont. Geeft de voorkeur aan zeldzamere namen (Maksymilian, Tomasz) boven de typische "Jans". In tegenspraak met de epidemiologie — het enige model dat geen vrouwelijke patiënt kan genereren, zelfs niet voor depressie of GAD.
Grok-4 Fast — meest genderbalanced
52% V / 48% M in totaal. Breedste leeftijdsbereik — 28 tot 42.
| Stoornis | Vrouw | Man | Verdeling | Gemiddelde leeftijd | Min-Max |
|---|---|---|---|---|---|
| OCD | 2 (20%) | 8 (80%) | 35.6 | 28-42 | |
| NPD | 0 (0%) | 10 (100%) | 39.2 | 35-42 | |
| Depressie | 10 (100%) | 0 (0%) | 34.5 | 28-42 | |
| GAD | 9 (90%) | 1 (10%) | 36.0 | 28-42 |
Beste voor GAD/depressie qua overeenstemming met de epidemiologie (90-100% V tegenover de reële 65%). Het enige model dat 42-jarigen oplevert. Meest voorkomend: "Anna Kowalska, 42" of "Marcin Nowak, 42".
DeepSeek-Chat — sterkste naam-niveau mode collapse
Jan Kowalski is goed voor 40% van alle voornamen, 55% van de achternamen. Maar GAD = 50/50 qua geslacht.
| Stoornis | Vrouw | Man | Verdeling | Gemiddelde leeftijd | Min-Max |
|---|---|---|---|---|---|
| OCD | 4 (40%) | 6 (60%) | 33.0 | 32-34 | |
| NPD | 0 (0%) | 10 (100%) | 34.6 | 32-42 | |
| Depressie | 4 (40%) | 6 (60%) | 32.8 | 32-34 | |
| GAD | 5 (50%) | 5 (50%) | 33.0 | 32-34 |
Paradoxaal genoeg — het meest genderbalanced voor GAD (50/50), ook al komt "Kowalski" voor in 22 van de 40 reacties (55%). De meest "leerboek"-achtige Poolse output (populairste achternaam + populairste mannelijke voornaam).
Elk model heeft een "favoriete patiënt"
De meest gegenereerde voornaam + achternaam + leeftijd voor elk model × stoornis-paar. Cijfers tussen haakjes = aantal keren voorgekomen op 10 prompts.
| Model | OCD | NPD | Depressie | GAD |
|---|---|---|---|---|
| claude-opus-4.7 | Katarzyna Wiśniewska, 34 6/10 | Krzysztof Majewski, 38 3/10 | Katarzyna Wiśniewska, 34 3/10 | Katarzyna Wiśniewska, 34 9/10 |
| claude-sonnet-4.6 | Marta Kowalczyk, 34 4/10 | Radosław Kędzierski, 34 2/10 | Marta Kowalczyk, 34 2/10 | Katarzyna Wiśniewska, 34 2/10 |
| gpt-5.5 | Michał Kowalski, 32 3/10 | Michał Wysocki, 34 3/10 | Michał Wysocki, 34 1/10 | Michał Wójcik, 34 2/10 |
| gemini-3.1-pro | Tomasz Kamiński, 28 2/10 | Maksymilian + diversen 1/10 | diversen 1/10 | Michał Wiśniewski, 35 2/10 |
| grok-4-fast | Michał Nowak, 28 2/10 | Michał Nowak, 42 2/10 | Maria Nowak, 32 2/10 | Anna Kowalska, 42 2/10 |
| deepseek-chat | Jan Kowalski, 32 4/10 | Jan Kowalski, 34 3/10 | Jan Kowalski, 32 5/10 | Jan Kowalski, 32 4/10 |
Diversiteitsranglijst (unieke volledige naam / totaal)
| Model | Diversiteit | Meest voorkomende voornaam | Meest voorkomende achternaam | Mode collapse |
|---|---|---|---|---|
| gemini-3.1-pro | 70% | Tomasz (32%) | Wiśniewski (25%) | 🟢 laag |
| gpt-5.5 | 52% | Michał (57%) | Wysocki (40%) | 🟡 gemiddeld |
| claude-sonnet-4.6 | 48% | Katarzyna (20%) | Kowalczyk (22%) | 🟡 gemiddeld |
| grok-4-fast | 45% | Anna (28%) | Nowak (42%) | 🟡 gemiddeld |
| deepseek-chat | 35% | Jan (40%) | Kowalski (55%) | 🔴 hoog |
| claude-opus-4.7 | 32% | Katarzyna (75%) | Wiśniewska (50%) | 🔴 hoog |
Wat dit betekent voor TherapySupport
Praktische lessen uit het onderzoek — waar LLM-bias kan doorsijpelen in therapeutisch werk, en waar in te grijpen.
Modelbias kan klinische intuïtie vormgeven
Wanneer het model scenario's "suggereert", doet het dat richting zijn eigen archetype
Modellen die worden gebruikt om voorbeeldcases te genereren (casestudy's, trainingsmockups, educatief materiaal) versterken systematisch stereotypen. Een clinicus die een LLM gebruikt om te brainstormen, ontvangt een door bias gefilterde lijst met ideeën — bijvoorbeeld altijd een vrouw met angst, altijd een man met NPD.
Atypische patiënten worden onzichtbaar
Een man met GAD, een vrouw met NPD — de modellen "zien" ze simpelweg niet
Als de modellen 100% mannelijke NPD-patiënten en 100% vrouwelijke GAD-patiënten genereren (Opus, Grok), sluit hun "patiëntenvocabulaire" de reële gevallen van het niet-dominante geslacht uit. Dit is relevant voor AI-ondersteunde sessiesamenvattingen, diagnostische suggesties of automatische tagging.
Modelkeuze doet ertoe
Geef bij educatieve taken de voorkeur aan een "divers" model boven een "geconcentreerd" model
Als het doel diversiteit van voorbeelden is (bijvoorbeeld trainingsmateriaal dat de breedte van patiënten toont) — kies Gemini 3.1 Pro of Grok-4 Fast. Als het doel een "leerboek"-prototypepatiënt is (bijvoorbeeld een case voor UI-tests) — kies Claude Opus of DeepSeek (sterkste modus).
| Doel | Aanbevolen model | Waarom |
|---|---|---|
| Trainingsmateriaal | Gemini 3.1 Pro · Grok-4 | Hoogste diversiteit aan namen en leeftijden |
| UI-tests / mockdata | DeepSeek · Claude Opus | Stabiele, "modale" archetypes |
| Genderbalanced sets | Grok-4 Fast | 52% V / 48% M in totaal |
| Diversity-aware research | Combineer output van 3+ modellen | Verschillende biases heffen elkaar op |
Mitigaties bij het werken met LLM's
Concrete prompt- en validatietechnieken die bias verminderen
- Forceer demografische variatie in de prompt: "Genereer een 22-jarige vrouwelijke patiënt met NPD" in plaats van een open "genereer een patiënt met NPD".
- Gebruik seeds / meerdere aanroepen: genereer 5-10 kandidaten en selecteer willekeurig in plaats van de eerste te nemen.
- Combineer reacties van verschillende modellen: een optelling van Gemini + Grok + DeepSeek geeft een veel bredere verdeling dan één enkel model.
- Audit de output: eens per kwartaal — genereer N=100 reacties en controleer de verdeling van geslacht, leeftijd, achternamen. De patronen verschuiven met elke modelupdate.
Brongegevens en replicatie
Alle 240 ruwe reacties zijn op aanvraag beschikbaar. Replicatiescripts eveneens op aanvraag.
| Item | Waarde |
|---|---|
| Totaal aantal query's | 240 (6 modellen × 4 stoornissen × 10 herhalingen) |
| Temperatuur | 0.9 |
| Max tokens | 60 (200 voor GPT-5.5, 2000 voor Gemini 3.1) |
| Hoe aangeroepen | HTTPS POST naar de OpenRouter API, parallel (asyncio + httpx) |
| Gelijktijdigheid | 20 (semafoor) |
| Doorlooptijd | ~3 min voor 240 aanroepen |
| Taal | Pools (prompt en verwachte output) |
| Genderclassificatie | Heuristiek: voornaam eindigend op "a" → vrouw, anders → man (typerend voor het Pools) |
Beperkingen van het onderzoek
- Kleine steekproef per cel: 10 herhalingen is te weinig voor strikte statistische significantie. De resultaten beschrijven een tendens, geen bewijs.
- Genderheuristiek: classificeren op basis van de naamuitgang is onvolmaakt (bijvoorbeeld "Kuba", "Bonifacy"). In de praktijk werkt dit >95% voor Poolse namen.
- Slechts 4 stoornissen: voor een vollediger beeld is uitbreiding nodig naar BPD, ADHD, schizofrenie, PTSS, autisme.
- Alleen Poolse context: bias kan er heel anders uitzien voor Engelse, Duitse of Spaanse patiënten.
- Momentopname: resultaten geldig voor de modelversies van april 2026. Na modelupdates kunnen de patronen verschuiven.
Download de ruwe data (19 KB)
Laat je e-mailadres achter — we sturen je de ZIP: alle 240 LLM-antwoorden (results.json), samenvattende rapporten (final_report.md, per_model_report.md) en de Python-scripts om het experiment te reproduceren.
CC-BY 4.0 · Geen paywall · Geen verkoop-follow-up.