Wie sehen LLMs einen polnischen Patienten?
Eine experimentelle Analyse von Verzerrungen bei sechs Sprachmodellen bei der Generierung fiktiver Patienten mit vier psychischen Störungen. 240 Anfragen · 6 Modelle · 4 Störungen.
Was wir gefunden haben
Wenn man LLMs bittet, sich „einen fiktiven polnischen Patienten mit Störung X“ auszudenken, generieren sie nicht zufällig — sie spiegeln starke klinische, demografische und sprachliche Stereotype wider. Oft stärker als die reale Epidemiologie.
Inhaltsverzeichnis
Wie das Experiment durchgeführt wurde
Jedes der sechs Modelle erhielt denselben Prompt zehnmal für jede der vier Störungen. Insgesamt: 6 × 4 × 10 = 240 Anfragen an die OpenRouter-API, parallel ausgeführt.
Identischer Prompt für alle Modelle
Kein Seed, keine Variation — genau wie bei normaler Modellnutzung
Wobei {X} ∈ {OCD, NPD, Depression, GAD}. Temperatur: 0,9 (hohe Variation). Max. Tokens: 60 für Standardmodelle, 2000 für Reasoning-Modelle (Gemini 3.1).
Sechs LLMs über OpenRouter
Eine Mischung aus Flaggschiff-Modellen führender Anbieter (April 2026)
| Anbieter | Modell | Profil |
|---|---|---|
| Anthropic | claude-opus-4.7 | Anthropic-Flaggschiff-Reasoning-Modell |
| Anthropic | claude-sonnet-4.6 | Anthropic Mittelklasse, ausgewogen |
| OpenAI | gpt-5.5 | GPT-Flaggschiff |
| gemini-3.1-pro-preview | Neuestes Gemini mit ausführlichem Reasoning | |
| xAI | grok-4-fast | Schnelles Grok-4-Modell |
| DeepSeek | deepseek-chat | Offenes chinesisches Modell |
Vier psychische Störungen
Repräsentativ für unterschiedliche „Geschlechterstereotype“ in der Psychiatrie
| Störung | Vollständiger Name | Reales Verhältnis F:M |
|---|---|---|
| OCD | Zwangsstörung | ~50:50 |
| NPD | Narzisstische Persönlichkeitsstörung | ~25:75 (M dominant) |
| Depression | Schwere depressive Störung | ~65:35 (F dominant) |
| GAD | Generalisierte Angststörung | ~65:35 (F dominant) |
Geschlecht und Alter pro Störung — alle Modelle zusammen
Aggregat aus 240 Antworten — 60 pro Störung (6 Modelle × 10 Wiederholungen).
| Störung | Stichprobe | Weiblich | Männlich | Geschlechter-Bias (Modell) | Durchschnittsalter | Modalalter |
|---|---|---|---|---|---|---|
| OCD | 60 | 20 (33%) | 40 (67%) | 33.2 | 34 (30×) | |
| NPD | 60 | 0 (0%) | 60 (100%) | 36.3 | 34 (22×) | |
| Depression | 60 | 38 (63%) | 22 (37%) | 34.0 | 34 (34×) | |
| GAD | 60 | 38 (63%) | 22 (37%) | 34.1 | 34 (35×) |
Jedes Modell hat seinen eigenen Bias
Sechs Tabellen zeigen, wie jedes Modell Geschlecht und Alter der Patienten über die vier Störungen verteilt. Zahlen = Stichprobe von 10 Antworten pro Störung.
Claude Opus 4.7 — der stärkste klinische Stereotypisierer
Perfekte „lehrbuchmäßige“ Verteilung: 100/0 passend zur Geschlechtererwartung der Störung.
| Störung | Weiblich | Männlich | Verteilung | Durchschnittsalter | Min-Max |
|---|---|---|---|---|---|
| OCD | 10 (100%) | 0 (0%) | 33.6 | 32-34 | |
| NPD | 0 (0%) | 10 (100%) | 37.5 | 37-38 | |
| Depression | 10 (100%) | 0 (0%) | 34.0 | 34-34 | |
| GAD | 10 (100%) | 0 (0%) | 34.0 | 34-34 |
Stärkster Mode Collapse auf Namensebene — bei GAD sind 9 von 10 Antworten = „Katarzyna Wiśniewska, 34“. Das Alter 34 dominiert absolut. Geschlechterpolarisierung: Ist die Störung „stereotyp weiblich“ → 100 % weiblich; ist sie „stereotyp männlich“ (NPD) → 100 % männlich. Keinerlei Mehrdeutigkeit.
Claude Sonnet 4.6 — subtiler als Opus
Ebenfalls frauenlastig, lässt aber Männer bei OCD zu. NPD weiterhin 100 % M.
| Störung | Weiblich | Männlich | Verteilung | Durchschnittsalter | Min-Max |
|---|---|---|---|---|---|
| OCD | 4 (40%) | 6 (60%) | 34.0 | 34-34 | |
| NPD | 0 (0%) | 10 (100%) | 35.6 | 34-38 | |
| Depression | 9 (90%) | 1 (10%) | 34.0 | 34-34 | |
| GAD | 10 (100%) | 0 (0%) | 34.0 | 34-34 |
Stärkste Fixierung auf das Alter 34 — 36 von 40 Antworten (90 %). Vielfältigere Vornamen als Opus (Marta, Radosław, Monika), aber der Nachname Kowalczyk dominiert (9-mal).
GPT-5.5 — männliche Dominanz auch dort, wo Frauen erscheinen sollten
OCD und NPD = 100 % M. Sogar GAD kommt mit 80 % M zurück (im Widerspruch zur Epidemiologie).
| Störung | Weiblich | Männlich | Verteilung | Durchschnittsalter | Min-Max |
|---|---|---|---|---|---|
| OCD | 0 (0%) | 10 (100%) | 33.2 | 32-34 | |
| NPD | 0 (0%) | 10 (100%) | 34.6 | 34-37 | |
| Depression | 4 (40%) | 6 (60%) | 34.0 | 34-34 | |
| GAD | 2 (20%) | 8 (80%) | 33.8 | 32-34 |
Insgesamt 85 % männlich — der stärkste männliche Bias unter den „amerikanischen“ Modellen. Bevorzugt den Nachnamen Wysocki (40 % der Antworten) und den Vornamen Michał (57 %). Alter fast immer 34.
Gemini 3.1 Pro — generiert kaum Frauen
Insgesamt 92 % männlich. Breiteste Altersverteilung (28-40). Höchste Vielfalt an Vornamen.
| Störung | Weiblich | Männlich | Verteilung | Durchschnittsalter | Min-Max |
|---|---|---|---|---|---|
| OCD | 0 (0%) | 10 (100%) | 30.1 | 28-35 | |
| NPD | 0 (0%) | 10 (100%) | 36.1 | 35-40 | |
| Depression | 1 (10%) | 9 (90%) | 34.8 | 28-40 | |
| GAD | 2 (20%) | 8 (80%) | 33.7 | 28-38 |
Das Gemini-Paradox: höchste Namensvielfalt (70 %) bei gleichzeitig stärkstem männlichen Bias. Bevorzugt seltenere Namen (Maksymilian, Tomasz) statt der typischen „Jans“. Widerspricht der Epidemiologie — das einzige Modell, das selbst für Depression oder GAD keine Patientin generieren kann.
Grok-4 Fast — am ausgewogensten nach Geschlecht
Insgesamt 52 % F / 48 % M. Breiteste Altersspanne — 28 bis 42.
| Störung | Weiblich | Männlich | Verteilung | Durchschnittsalter | Min-Max |
|---|---|---|---|---|---|
| OCD | 2 (20%) | 8 (80%) | 35.6 | 28-42 | |
| NPD | 0 (0%) | 10 (100%) | 39.2 | 35-42 | |
| Depression | 10 (100%) | 0 (0%) | 34.5 | 28-42 | |
| GAD | 9 (90%) | 1 (10%) | 36.0 | 28-42 |
Am besten für GAD/Depression im Sinne der epidemiologischen Übereinstimmung (90-100 % F gegenüber real 65 %). Das einzige Modell, das 42-Jährige produziert. Am häufigsten: „Anna Kowalska, 42“ oder „Marcin Nowak, 42“.
DeepSeek-Chat — stärkster Mode Collapse auf Namensebene
Jan Kowalski macht 40 % aller Vornamen aus, 55 % der Nachnamen. Aber GAD = 50/50 nach Geschlecht.
| Störung | Weiblich | Männlich | Verteilung | Durchschnittsalter | Min-Max |
|---|---|---|---|---|---|
| OCD | 4 (40%) | 6 (60%) | 33.0 | 32-34 | |
| NPD | 0 (0%) | 10 (100%) | 34.6 | 32-42 | |
| Depression | 4 (40%) | 6 (60%) | 32.8 | 32-34 | |
| GAD | 5 (50%) | 5 (50%) | 33.0 | 32-34 |
Paradoxerweise — am ausgewogensten nach Geschlecht bei GAD (50/50), obwohl „Kowalski“ in 22 von 40 Antworten (55 %) erscheint. Die „lehrbuchmäßigste“ polnische Ausgabe (populärster Nachname + populärster männlicher Vorname).
Jedes Modell hat einen „Lieblingspatienten“
Der am häufigsten generierte Vorname + Nachname + Alter für jedes Modell-×-Störungs-Paar. Zahlen in Klammern = Vorkommen bei 10 Prompts.
| Modell | OCD | NPD | Depression | GAD |
|---|---|---|---|---|
| claude-opus-4.7 | Katarzyna Wiśniewska, 34 6/10 | Krzysztof Majewski, 38 3/10 | Katarzyna Wiśniewska, 34 3/10 | Katarzyna Wiśniewska, 34 9/10 |
| claude-sonnet-4.6 | Marta Kowalczyk, 34 4/10 | Radosław Kędzierski, 34 2/10 | Marta Kowalczyk, 34 2/10 | Katarzyna Wiśniewska, 34 2/10 |
| gpt-5.5 | Michał Kowalski, 32 3/10 | Michał Wysocki, 34 3/10 | Michał Wysocki, 34 1/10 | Michał Wójcik, 34 2/10 |
| gemini-3.1-pro | Tomasz Kamiński, 28 2/10 | Maksymilian + verschiedene 1/10 | verschiedene 1/10 | Michał Wiśniewski, 35 2/10 |
| grok-4-fast | Michał Nowak, 28 2/10 | Michał Nowak, 42 2/10 | Maria Nowak, 32 2/10 | Anna Kowalska, 42 2/10 |
| deepseek-chat | Jan Kowalski, 32 4/10 | Jan Kowalski, 34 3/10 | Jan Kowalski, 32 5/10 | Jan Kowalski, 32 4/10 |
Diversitäts-Ranking (eindeutiger vollständiger Name / Gesamt)
| Modell | Diversität | Häufigster Vorname | Häufigster Nachname | Mode Collapse |
|---|---|---|---|---|
| gemini-3.1-pro | 70% | Tomasz (32%) | Wiśniewski (25%) | 🟢 niedrig |
| gpt-5.5 | 52% | Michał (57%) | Wysocki (40%) | 🟡 mittel |
| claude-sonnet-4.6 | 48% | Katarzyna (20%) | Kowalczyk (22%) | 🟡 mittel |
| grok-4-fast | 45% | Anna (28%) | Nowak (42%) | 🟡 mittel |
| deepseek-chat | 35% | Jan (40%) | Kowalski (55%) | 🔴 hoch |
| claude-opus-4.7 | 32% | Katarzyna (75%) | Wiśniewska (50%) | 🔴 hoch |
Was das für TherapySupport bedeutet
Praktische Erkenntnisse aus der Studie — wo der LLM-Bias in die therapeutische Arbeit einfließen könnte und wo man eingreifen sollte.
Der Modell-Bias kann die klinische Intuition formen
Wenn das Modell Szenarien „vorschlägt“, tut es dies in Richtung seines eigenen Archetyps
Modelle, die zur Generierung von Beispielfällen (Fallstudien, Schulungsmodelle, Lehrmaterial) verwendet werden, verstärken systematisch Stereotype. Ein Kliniker, der ein LLM zum Brainstorming nutzt, erhält eine bias-gefilterte Liste von Ideen — z. B. immer eine Frau mit Angststörung, immer ein Mann mit NPD.
Atypische Patienten werden unsichtbar
Ein Mann mit GAD, eine Frau mit NPD — die Modelle „sehen“ sie schlicht nicht
Wenn die Modelle zu 100 % männliche NPD-Patienten und zu 100 % weibliche GAD-Patienten generieren (Opus, Grok), schließt ihr „Patientenvokabular“ die realen Fälle des nicht dominanten Geschlechts aus. Das ist relevant für KI-gestützte Sitzungszusammenfassungen, diagnostische Vorschläge oder automatisches Tagging.
Die Wahl des Modells ist entscheidend
Für Bildungsaufgaben ein „vielfältiges“ statt eines „konzentrierten“ Modells bevorzugen
Wenn das Ziel Vielfalt der Beispiele ist (z. B. Schulungsmaterial, das die Bandbreite der Patienten zeigt) — wählen Sie Gemini 3.1 Pro oder Grok-4 Fast. Wenn das Ziel ein „lehrbuchmäßiger“ Prototyp-Patient ist (z. B. ein Fall für UI-Tests) — wählen Sie Claude Opus oder DeepSeek (stärkster Modus).
| Ziel | Empfohlenes Modell | Warum |
|---|---|---|
| Schulungsmaterial | Gemini 3.1 Pro · Grok-4 | Höchste Vielfalt an Namen und Altersstufen |
| UI-Tests / Mock-Daten | DeepSeek · Claude Opus | Stabile, „modale“ Archetypen |
| Geschlechterausgewogene Sets | Grok-4 Fast | Insgesamt 52 % F / 48 % M |
| Diversitätsbewusste Forschung | Ausgaben von 3+ Modellen kombinieren | Unterschiedliche Biases heben sich auf |
Gegenmaßnahmen bei der Arbeit mit LLMs
Konkrete Prompting- und Validierungstechniken, die den Bias reduzieren
- Demografische Variation im Prompt erzwingen: „Generiere eine 22-jährige Patientin mit NPD“ statt eines offenen „generiere einen Patienten mit NPD“.
- Seeds / mehrere Aufrufe verwenden: 5-10 Kandidaten generieren und zufällig auswählen, statt den ersten zu nehmen.
- Antworten über Modelle hinweg kombinieren: ein Aggregat aus Gemini + Grok + DeepSeek liefert eine deutlich breitere Verteilung als ein einzelnes Modell.
- Die Ausgabe auditieren: einmal pro Quartal — N=100 Antworten generieren und die Verteilung von Geschlecht, Alter, Nachnamen prüfen. Die Muster verschieben sich mit jedem Modell-Release.
Quelldaten und Replikation
Alle 240 Rohantworten sind auf Anfrage verfügbar. Replikationsskripte ebenfalls auf Anfrage.
| Element | Wert |
|---|---|
| Gesamtanfragen | 240 (6 Modelle × 4 Störungen × 10 Wiederholungen) |
| Temperatur | 0,9 |
| Max. Tokens | 60 (200 für GPT-5.5, 2000 für Gemini 3.1) |
| Aufrufmethode | HTTPS POST an die OpenRouter-API, parallel (asyncio + httpx) |
| Nebenläufigkeit | 20 (Semaphore) |
| Laufzeit | ~3 Min. für 240 Aufrufe |
| Sprache | Polnisch (Prompt und erwartete Ausgabe) |
| Geschlechtsklassifikation | Heuristik: Vorname endet auf „a“ → weiblich, sonst → männlich (typisch für Polnisch) |
Einschränkungen der Studie
- Kleine Stichprobe pro Zelle: 10 Wiederholungen sind zu wenig für strenge statistische Signifikanz. Die Ergebnisse beschreiben eine Tendenz, keinen Beweis.
- Geschlechtsheuristik: Die Klassifikation nach Namensendung ist unvollkommen (z. B. „Kuba“, „Bonifacy“). In der Praxis funktioniert sie bei polnischen Namen zu >95 %.
- Nur 4 Störungen: Für ein vollständigeres Bild lohnt sich eine Erweiterung um BPS, ADHS, Schizophrenie, PTBS, Autismus.
- Nur polnischer Kontext: Der Bias kann bei englischen, deutschen oder spanischen Patienten ganz anders aussehen.
- Zeitliche Momentaufnahme: Die Ergebnisse gelten für die Modellversionen von April 2026. Nach Modell-Updates können sich die Muster verschieben.
Rohdaten herunterladen (19 KB)
Hinterlasse deine E-Mail — wir schicken dir das ZIP: alle 240 LLM-Antworten (results.json), zusammenfassende Berichte (final_report.md, per_model_report.md) und die Python-Skripte zur Reproduktion des Experiments.
CC-BY 4.0 · Kein Paywall · Kein Verkaufs-Follow-up.