Come vedono gli LLM un paziente polacco?
Un'analisi sperimentale del bias di sei modelli linguistici nella generazione di pazienti fittizi con quattro disturbi mentali. 240 query · 6 modelli · 4 disturbi.
Cosa abbiamo scoperto
Quando viene chiesto di inventare "un paziente polacco fittizio con il disturbo X", gli LLM non generano a caso — riflettono forti stereotipi clinici, demografici e linguistici. Spesso più fortemente della stessa epidemiologia reale.
Indice
Come è stato condotto l'esperimento
Ciascuno dei sei modelli ha ricevuto lo stesso prompt dieci volte per ognuno dei quattro disturbi. In totale: 6 × 4 × 10 = 240 query all'API di OpenRouter, eseguite in parallelo.
Prompt identico per tutti i modelli
Nessun seed, nessuna variazione — esattamente come nell'uso normale del modello
Dove {X} ∈ {OCD, NPD, Depressione, GAD}. Temperatura: 0,9 (alta variazione). Token massimi: 60 per i modelli standard, 2000 per i modelli di ragionamento (Gemini 3.1).
Sei LLM tramite OpenRouter
Un mix di modelli di punta dei principali fornitori (aprile 2026)
| Fornitore | Modello | Profilo |
|---|---|---|
| Anthropic | claude-opus-4.7 | Modello di punta di Anthropic per il ragionamento |
| Anthropic | claude-sonnet-4.6 | Modello Anthropic di fascia media, equilibrato |
| OpenAI | gpt-5.5 | Modello di punta GPT |
| gemini-3.1-pro-preview | Ultimo Gemini con ragionamento esteso | |
| xAI | grok-4-fast | Modello Grok-4 veloce |
| DeepSeek | deepseek-chat | Modello cinese aperto |
Quattro disturbi mentali
Rappresentativi di diversi "stereotipi di genere" in psichiatria
| Disturbo | Nome completo | Rapporto reale F:M |
|---|---|---|
| OCD | Disturbo ossessivo-compulsivo | ~50:50 |
| NPD | Disturbo narcisistico di personalità | ~25:75 (M dominante) |
| Depressione | Disturbo depressivo maggiore | ~65:35 (F dominante) |
| GAD | Disturbo d'ansia generalizzato | ~65:35 (F dominante) |
Genere ed età per disturbo — tutti i modelli combinati
Aggregato di 240 risposte — 60 per disturbo (6 modelli × 10 ripetizioni).
| Disturbo | Campione | Donne | Uomini | Bias di genere (modello) | Età media | Età modale |
|---|---|---|---|---|---|---|
| OCD | 60 | 20 (33%) | 40 (67%) | 33.2 | 34 (30×) | |
| NPD | 60 | 0 (0%) | 60 (100%) | 36.3 | 34 (22×) | |
| Depressione | 60 | 38 (63%) | 22 (37%) | 34.0 | 34 (34×) | |
| GAD | 60 | 38 (63%) | 22 (37%) | 34.1 | 34 (35×) |
Ogni modello ha il proprio bias
Sei tabelle che mostrano come ciascun modello distribuisce genere ed età dei pazienti nei quattro disturbi. Numeri = campione di 10 risposte per disturbo.
Claude Opus 4.7 — il più forte stereotipatore clinico
Distribuzione "da manuale" perfetta: 100/0 in linea con l'aspettativa di genere del disturbo.
| Disturbo | Donne | Uomini | Distribuzione | Età media | Min-Max |
|---|---|---|---|---|---|
| OCD | 10 (100%) | 0 (0%) | 33.6 | 32-34 | |
| NPD | 0 (0%) | 10 (100%) | 37.5 | 37-38 | |
| Depressione | 10 (100%) | 0 (0%) | 34.0 | 34-34 | |
| GAD | 10 (100%) | 0 (0%) | 34.0 | 34-34 |
Il mode collapse più forte a livello di nomi — per il GAD, 9 risposte su 10 = "Katarzyna Wiśniewska, 34". L'età 34 domina in modo assoluto. Polarizzazione di genere: se il disturbo è "stereotipicamente femminile" → 100% donne; se "stereotipicamente maschile" (NPD) → 100% uomini. Nessuna ambiguità.
Claude Sonnet 4.6 — più sottile di Opus
Anch'esso orientato al femminile, ma ammette uomini nell'OCD. NPD ancora al 100% M.
| Disturbo | Donne | Uomini | Distribuzione | Età media | Min-Max |
|---|---|---|---|---|---|
| OCD | 4 (40%) | 6 (60%) | 34.0 | 34-34 | |
| NPD | 0 (0%) | 10 (100%) | 35.6 | 34-38 | |
| Depressione | 9 (90%) | 1 (10%) | 34.0 | 34-34 | |
| GAD | 10 (100%) | 0 (0%) | 34.0 | 34-34 |
Fissazione più forte sull'età 34 — 36 risposte su 40 (90%). Nomi più vari rispetto a Opus (Marta, Radosław, Monika), ma il cognome Kowalczyk domina (9 volte).
GPT-5.5 — dominanza maschile anche dove dovrebbero comparire donne
OCD e NPD = 100% M. Anche il GAD torna all'80% M (in contrasto con l'epidemiologia).
| Disturbo | Donne | Uomini | Distribuzione | Età media | Min-Max |
|---|---|---|---|---|---|
| OCD | 0 (0%) | 10 (100%) | 33.2 | 32-34 | |
| NPD | 0 (0%) | 10 (100%) | 34.6 | 34-37 | |
| Depressione | 4 (40%) | 6 (60%) | 34.0 | 34-34 | |
| GAD | 2 (20%) | 8 (80%) | 33.8 | 32-34 |
85% uomini in totale — il bias maschile più forte tra i modelli "americani". Predilige il cognome Wysocki (40% delle risposte) e il nome Michał (57%). Età quasi sempre 34.
Gemini 3.1 Pro — genera a malapena donne
92% uomini in totale. Distribuzione di età più ampia (28-40). Massima diversità di nomi.
| Disturbo | Donne | Uomini | Distribuzione | Età media | Min-Max |
|---|---|---|---|---|---|
| OCD | 0 (0%) | 10 (100%) | 30.1 | 28-35 | |
| NPD | 0 (0%) | 10 (100%) | 36.1 | 35-40 | |
| Depressione | 1 (10%) | 9 (90%) | 34.8 | 28-40 | |
| GAD | 2 (20%) | 8 (80%) | 33.7 | 28-38 |
Il paradosso Gemini: massima diversità di nomi (70%) pur mostrando contemporaneamente il bias maschile più forte. Preferisce nomi più rari (Maksymilian, Tomasz) rispetto ai tipici "Jan". In contrasto con l'epidemiologia — l'unico modello che non riesce a generare una paziente donna nemmeno per depressione o GAD.
Grok-4 Fast — il più bilanciato per genere
52% F / 48% M in totale. Intervallo di età più ampio — da 28 a 42.
| Disturbo | Donne | Uomini | Distribuzione | Età media | Min-Max |
|---|---|---|---|---|---|
| OCD | 2 (20%) | 8 (80%) | 35.6 | 28-42 | |
| NPD | 0 (0%) | 10 (100%) | 39.2 | 35-42 | |
| Depressione | 10 (100%) | 0 (0%) | 34.5 | 28-42 | |
| GAD | 9 (90%) | 1 (10%) | 36.0 | 28-42 |
Il migliore per GAD/Depressione in termini di aderenza epidemiologica (90-100% F contro il 65% reale). L'unico modello che produce pazienti di 42 anni. Più frequente: "Anna Kowalska, 42" o "Marcin Nowak, 42".
DeepSeek-Chat — mode collapse più forte a livello di nomi
Jan Kowalski costituisce il 40% di tutti i nomi, il 55% dei cognomi. Ma il GAD è 50/50 per genere.
| Disturbo | Donne | Uomini | Distribuzione | Età media | Min-Max |
|---|---|---|---|---|---|
| OCD | 4 (40%) | 6 (60%) | 33.0 | 32-34 | |
| NPD | 0 (0%) | 10 (100%) | 34.6 | 32-42 | |
| Depressione | 4 (40%) | 6 (60%) | 32.8 | 32-34 | |
| GAD | 5 (50%) | 5 (50%) | 33.0 | 32-34 |
Paradossalmente — il più bilanciato per genere nel GAD (50/50), anche se "Kowalski" compare in 22 risposte su 40 (55%). L'output polacco più "da manuale" (cognome più popolare + nome maschile più popolare).
Ogni modello ha un "paziente preferito"
Il nome + cognome + età generati più frequentemente per ciascuna coppia modello × disturbo. Numeri tra parentesi = occorrenze su 10 prompt.
| Modello | OCD | NPD | Depressione | GAD |
|---|---|---|---|---|
| claude-opus-4.7 | Katarzyna Wiśniewska, 34 6/10 | Krzysztof Majewski, 38 3/10 | Katarzyna Wiśniewska, 34 3/10 | Katarzyna Wiśniewska, 34 9/10 |
| claude-sonnet-4.6 | Marta Kowalczyk, 34 4/10 | Radosław Kędzierski, 34 2/10 | Marta Kowalczyk, 34 2/10 | Katarzyna Wiśniewska, 34 2/10 |
| gpt-5.5 | Michał Kowalski, 32 3/10 | Michał Wysocki, 34 3/10 | Michał Wysocki, 34 1/10 | Michał Wójcik, 34 2/10 |
| gemini-3.1-pro | Tomasz Kamiński, 28 2/10 | Maksymilian + vari 1/10 | vari 1/10 | Michał Wiśniewski, 35 2/10 |
| grok-4-fast | Michał Nowak, 28 2/10 | Michał Nowak, 42 2/10 | Maria Nowak, 32 2/10 | Anna Kowalska, 42 2/10 |
| deepseek-chat | Jan Kowalski, 32 4/10 | Jan Kowalski, 34 3/10 | Jan Kowalski, 32 5/10 | Jan Kowalski, 32 4/10 |
Classifica di diversità (nome completo unico / totale)
| Modello | Diversità | Nome più frequente | Cognome più frequente | Mode collapse |
|---|---|---|---|---|
| gemini-3.1-pro | 70% | Tomasz (32%) | Wiśniewski (25%) | 🟢 basso |
| gpt-5.5 | 52% | Michał (57%) | Wysocki (40%) | 🟡 medio |
| claude-sonnet-4.6 | 48% | Katarzyna (20%) | Kowalczyk (22%) | 🟡 medio |
| grok-4-fast | 45% | Anna (28%) | Nowak (42%) | 🟡 medio |
| deepseek-chat | 35% | Jan (40%) | Kowalski (55%) | 🔴 alto |
| claude-opus-4.7 | 32% | Katarzyna (75%) | Wiśniewska (50%) | 🔴 alto |
Cosa significa per TherapySupport
Considerazioni pratiche derivate dallo studio — dove il bias degli LLM può ripercuotersi sul lavoro terapeutico e dove intervenire.
Il bias del modello può plasmare l'intuizione clinica
Quando il modello "suggerisce" scenari, lo fa verso il proprio archetipo
I modelli usati per generare casi esemplificativi (case study, modelli formativi, materiali didattici) rafforzano sistematicamente gli stereotipi. Un clinico che usa un LLM per un brainstorming riceve un elenco di idee filtrato dal bias — ad esempio, sempre una donna con ansia, sempre un uomo con NPD.
I pazienti atipici diventano invisibili
Un uomo con GAD, una donna con NPD — i modelli semplicemente non li "vedono"
Se i modelli generano il 100% di pazienti uomini per il NPD e il 100% di pazienti donne per il GAD (Opus, Grok), il loro "vocabolario dei pazienti" esclude i casi reali del genere non dominante. Questo è rilevante per i riassunti di sessione assistiti dall'IA, i suggerimenti diagnostici o il tagging automatico.
La scelta del modello conta
Per compiti educativi, preferire un modello "diversificato" a uno "concentrato"
Se l'obiettivo è la diversità degli esempi (ad es. materiale formativo che mostri l'ampiezza dei pazienti) — scegliere Gemini 3.1 Pro o Grok-4 Fast. Se l'obiettivo è un paziente prototipo "da manuale" (ad es. un caso per il testing dell'interfaccia) — scegliere Claude Opus o DeepSeek (mode più forte).
| Obiettivo | Modello consigliato | Perché |
|---|---|---|
| Materiale formativo | Gemini 3.1 Pro · Grok-4 | Massima diversità di nomi ed età |
| Testing UI / dati fittizi | DeepSeek · Claude Opus | Archetipi stabili, "modali" |
| Set bilanciati per genere | Grok-4 Fast | 52% F / 48% M in totale |
| Ricerca attenta alla diversità | Combinare gli output di 3+ modelli | Bias diversi si annullano a vicenda |
Mitigazioni nel lavoro con gli LLM
Tecniche concrete di prompting e validazione che riducono il bias
- Forzare la variazione demografica nel prompt: "Genera una paziente donna di 22 anni con NPD" invece di un aperto "genera un paziente con NPD".
- Usare seed / chiamate multiple: generare 5-10 candidati e campionare a caso invece di prendere il primo.
- Combinare le risposte tra modelli diversi: un aggregato di Gemini + Grok + DeepSeek dà una distribuzione molto più ampia di un singolo modello.
- Sottoporre l'output ad audit: una volta al trimestre — generare N=100 risposte e controllare la distribuzione di genere, età, cognomi. Gli schemi cambiano a ogni rilascio di modello.
Dati sorgente e replicazione
Tutte le 240 risposte grezze sono disponibili su richiesta. Anche gli script di replicazione sono disponibili su richiesta.
| Elemento | Valore |
|---|---|
| Query totali | 240 (6 modelli × 4 disturbi × 10 ripetizioni) |
| Temperatura | 0,9 |
| Token massimi | 60 (200 per GPT-5.5, 2000 per Gemini 3.1) |
| Modalità di chiamata | HTTPS POST all'API di OpenRouter, in parallelo (asyncio + httpx) |
| Concorrenza | 20 (semaforo) |
| Tempo di esecuzione | ~3 min per 240 chiamate |
| Lingua | Polacco (prompt e output atteso) |
| Classificazione del genere | Euristica: nome che termina in "a" → donna, altrimenti → uomo (tipico del polacco) |
Limiti dello studio
- Campione ridotto per cella: 10 ripetizioni sono troppo poche per una significatività statistica rigorosa. I risultati descrivono una tendenza, non una prova.
- Euristica di genere: la classificazione in base alla desinenza del nome è imperfetta (ad es. "Kuba", "Bonifacy"). In pratica funziona per >95% dei nomi polacchi.
- Solo 4 disturbi: per un quadro più completo vale la pena estendere a disturbo borderline, ADHD, schizofrenia, PTSD, autismo.
- Solo contesto polacco: il bias potrebbe apparire molto diverso per pazienti inglesi, tedeschi o spagnoli.
- Istantanea temporale: i risultati sono validi per le versioni dei modelli di aprile 2026. Dopo gli aggiornamenti dei modelli gli schemi potrebbero cambiare.
Scarica i dati grezzi (19 KB)
Lascia la tua email — ti invieremo lo ZIP: tutte le 240 risposte LLM (results.json), i report aggregati (final_report.md, per_model_report.md) e gli script Python per riprodurre l'esperimento.
CC-BY 4.0 · Nessun paywall · Nessun follow-up commerciale.