Comment les LLM voient-ils un patient polonais ?
Une analyse expérimentale du biais de six modèles de langage lors de la génération de patients fictifs présentant quatre troubles mentaux. 240 requêtes · 6 modèles · 4 troubles.
Ce que nous avons trouvé
Lorsqu'on leur demande d'inventer « un patient polonais fictif présentant le trouble X », les LLM ne génèrent pas au hasard — ils reflètent de forts stéréotypes cliniques, démographiques et linguistiques. Souvent plus fortement que l'épidémiologie réelle.
Table des matières
Comment l'expérience a été menée
Chacun des six modèles a reçu le même prompt dix fois pour chacun des quatre troubles. Au total : 6 × 4 × 10 = 240 requêtes vers l'API OpenRouter, exécutées en parallèle.
Prompt identique pour tous les modèles
Pas de seed, pas de variation — exactement comme en usage normal du modèle
Où {X} ∈ {OCD, NPD, Dépression, GAD}. Température : 0,9 (forte variation). Tokens max : 60 pour les modèles standards, 2000 pour les modèles de raisonnement (Gemini 3.1).
Six LLM via OpenRouter
Un mélange de modèles phares des principaux fournisseurs (avril 2026)
| Fournisseur | Modèle | Profil |
|---|---|---|
| Anthropic | claude-opus-4.7 | Modèle de raisonnement phare d'Anthropic |
| Anthropic | claude-sonnet-4.6 | Modèle intermédiaire d'Anthropic, équilibré |
| OpenAI | gpt-5.5 | Modèle phare GPT |
| gemini-3.1-pro-preview | Dernier Gemini avec raisonnement long | |
| xAI | grok-4-fast | Modèle Grok-4 rapide |
| DeepSeek | deepseek-chat | Modèle chinois ouvert |
Quatre troubles mentaux
Représentatifs de différents « stéréotypes de genre » en psychiatrie
| Trouble | Nom complet | Ratio F:H réel |
|---|---|---|
| OCD | Trouble obsessionnel-compulsif | ~50:50 |
| NPD | Trouble de la personnalité narcissique | ~25:75 (H dominant) |
| Dépression | Trouble dépressif majeur | ~65:35 (F dominant) |
| GAD | Trouble anxieux généralisé | ~65:35 (F dominant) |
Sexe et âge par trouble — tous modèles confondus
Agrégat de 240 réponses — 60 par trouble (6 modèles × 10 répétitions).
| Trouble | Échantillon | Femmes | Hommes | Biais de genre (modèle) | Âge moyen | Âge modal |
|---|---|---|---|---|---|---|
| OCD | 60 | 20 (33%) | 40 (67%) | 33.2 | 34 (30×) | |
| NPD | 60 | 0 (0%) | 60 (100%) | 36.3 | 34 (22×) | |
| Dépression | 60 | 38 (63%) | 22 (37%) | 34.0 | 34 (34×) | |
| GAD | 60 | 38 (63%) | 22 (37%) | 34.1 | 34 (35×) |
Chaque modèle a son propre biais
Six tableaux montrant comment chaque modèle répartit le sexe et l'âge des patients pour les quatre troubles. Chiffres = échantillon de 10 réponses par trouble.
Claude Opus 4.7 — le stéréotypeur clinique le plus marqué
Répartition « manuel scolaire » parfaite : 100/0 pour correspondre à l'attente de genre du trouble.
| Trouble | Femmes | Hommes | Répartition | Âge moyen | Min-Max |
|---|---|---|---|---|---|
| OCD | 10 (100%) | 0 (0%) | 33.6 | 32-34 | |
| NPD | 0 (0%) | 10 (100%) | 37.5 | 37-38 | |
| Dépression | 10 (100%) | 0 (0%) | 34.0 | 34-34 | |
| GAD | 10 (100%) | 0 (0%) | 34.0 | 34-34 |
Effondrement de mode le plus marqué au niveau des noms — pour le GAD, 9 réponses sur 10 = « Katarzyna Wiśniewska, 34 ». L'âge 34 domine totalement. Polarisation de genre : si le trouble est « stéréotypiquement féminin » → 100 % de femmes ; si « stéréotypiquement masculin » (NPD) → 100 % d'hommes. Aucune ambiguïté.
Claude Sonnet 4.6 — plus subtil qu'Opus
Également orienté femmes, mais autorise des hommes pour l'OCD. NPD toujours 100 % H.
| Trouble | Femmes | Hommes | Répartition | Âge moyen | Min-Max |
|---|---|---|---|---|---|
| OCD | 4 (40%) | 6 (60%) | 34.0 | 34-34 | |
| NPD | 0 (0%) | 10 (100%) | 35.6 | 34-38 | |
| Dépression | 9 (90%) | 1 (10%) | 34.0 | 34-34 | |
| GAD | 10 (100%) | 0 (0%) | 34.0 | 34-34 |
Fixation la plus forte sur l'âge 34 — 36 réponses sur 40 (90 %). Prénoms plus variés qu'Opus (Marta, Radosław, Monika), mais le nom de famille Kowalczyk domine (9 fois).
GPT-5.5 — dominance masculine même là où des femmes devraient apparaître
OCD et NPD = 100 % H. Même le GAD revient à 80 % H (contraire à l'épidémiologie).
| Trouble | Femmes | Hommes | Répartition | Âge moyen | Min-Max |
|---|---|---|---|---|---|
| OCD | 0 (0%) | 10 (100%) | 33.2 | 32-34 | |
| NPD | 0 (0%) | 10 (100%) | 34.6 | 34-37 | |
| Dépression | 4 (40%) | 6 (60%) | 34.0 | 34-34 | |
| GAD | 2 (20%) | 8 (80%) | 33.8 | 32-34 |
85 % d'hommes au total — le biais masculin le plus fort parmi les modèles « américains ». Affectionne le nom de famille Wysocki (40 % des réponses) et le prénom Michał (57 %). L'âge est presque toujours 34.
Gemini 3.1 Pro — génère à peine des femmes
92 % d'hommes au total. Répartition d'âge la plus large (28-40). Plus grande diversité de prénoms.
| Trouble | Femmes | Hommes | Répartition | Âge moyen | Min-Max |
|---|---|---|---|---|---|
| OCD | 0 (0%) | 10 (100%) | 30.1 | 28-35 | |
| NPD | 0 (0%) | 10 (100%) | 36.1 | 35-40 | |
| Dépression | 1 (10%) | 9 (90%) | 34.8 | 28-40 | |
| GAD | 2 (20%) | 8 (80%) | 33.7 | 28-38 |
Le paradoxe Gemini : la plus grande diversité de prénoms (70 %) tout en présentant simultanément le biais masculin le plus fort. Préfère des prénoms plus rares (Maksymilian, Tomasz) aux « Jan » typiques. Contraire à l'épidémiologie — le seul modèle incapable de générer une patiente même pour la dépression ou le GAD.
Grok-4 Fast — le plus équilibré en termes de genre
52 % F / 48 % H au total. Fourchette d'âge la plus large — de 28 à 42 ans.
| Trouble | Femmes | Hommes | Répartition | Âge moyen | Min-Max |
|---|---|---|---|---|---|
| OCD | 2 (20%) | 8 (80%) | 35.6 | 28-42 | |
| NPD | 0 (0%) | 10 (100%) | 39.2 | 35-42 | |
| Dépression | 10 (100%) | 0 (0%) | 34.5 | 28-42 | |
| GAD | 9 (90%) | 1 (10%) | 36.0 | 28-42 |
Meilleur pour le GAD/la Dépression en termes d'adéquation épidémiologique (90-100 % F contre 65 % réels). Le seul modèle qui produit des patients de 42 ans. Le plus fréquent : « Anna Kowalska, 42 » ou « Marcin Nowak, 42 ».
DeepSeek-Chat — l'effondrement de mode le plus marqué au niveau des noms
Jan Kowalski représente 40 % de tous les prénoms, 55 % des noms de famille. Mais le GAD = 50/50 par genre.
| Trouble | Femmes | Hommes | Répartition | Âge moyen | Min-Max |
|---|---|---|---|---|---|
| OCD | 4 (40%) | 6 (60%) | 33.0 | 32-34 | |
| NPD | 0 (0%) | 10 (100%) | 34.6 | 32-42 | |
| Dépression | 4 (40%) | 6 (60%) | 32.8 | 32-34 | |
| GAD | 5 (50%) | 5 (50%) | 33.0 | 32-34 |
Paradoxalement — le plus équilibré par genre pour le GAD (50/50), même si « Kowalski » apparaît dans 22 réponses sur 40 (55 %). La sortie polonaise la plus « scolaire » (nom de famille le plus populaire + prénom masculin le plus populaire).
Chaque modèle a un « patient préféré »
Le prénom + nom de famille + âge le plus fréquemment généré pour chaque paire modèle × trouble. Chiffres entre parenthèses = occurrences sur 10 prompts.
| Modèle | OCD | NPD | Dépression | GAD |
|---|---|---|---|---|
| claude-opus-4.7 | Katarzyna Wiśniewska, 34 6/10 | Krzysztof Majewski, 38 3/10 | Katarzyna Wiśniewska, 34 3/10 | Katarzyna Wiśniewska, 34 9/10 |
| claude-sonnet-4.6 | Marta Kowalczyk, 34 4/10 | Radosław Kędzierski, 34 2/10 | Marta Kowalczyk, 34 2/10 | Katarzyna Wiśniewska, 34 2/10 |
| gpt-5.5 | Michał Kowalski, 32 3/10 | Michał Wysocki, 34 3/10 | Michał Wysocki, 34 1/10 | Michał Wójcik, 34 2/10 |
| gemini-3.1-pro | Tomasz Kamiński, 28 2/10 | Maksymilian + divers 1/10 | divers 1/10 | Michał Wiśniewski, 35 2/10 |
| grok-4-fast | Michał Nowak, 28 2/10 | Michał Nowak, 42 2/10 | Maria Nowak, 32 2/10 | Anna Kowalska, 42 2/10 |
| deepseek-chat | Jan Kowalski, 32 4/10 | Jan Kowalski, 34 3/10 | Jan Kowalski, 32 5/10 | Jan Kowalski, 32 4/10 |
Classement de diversité (nom complet unique / total)
| Modèle | Diversité | Prénom principal | Nom principal | Effondrement de mode |
|---|---|---|---|---|
| gemini-3.1-pro | 70% | Tomasz (32%) | Wiśniewski (25%) | 🟢 faible |
| gpt-5.5 | 52% | Michał (57%) | Wysocki (40%) | 🟡 moyen |
| claude-sonnet-4.6 | 48% | Katarzyna (20%) | Kowalczyk (22%) | 🟡 moyen |
| grok-4-fast | 45% | Anna (28%) | Nowak (42%) | 🟡 moyen |
| deepseek-chat | 35% | Jan (40%) | Kowalski (55%) | 🔴 élevé |
| claude-opus-4.7 | 32% | Katarzyna (75%) | Wiśniewska (50%) | 🔴 élevé |
Ce que cela signifie pour TherapySupport
Enseignements pratiques de l'étude — où le biais des LLM peut se répercuter sur le travail thérapeutique, et où intervenir.
Le biais du modèle peut façonner l'intuition clinique
Quand le modèle « suggère » des scénarios, il le fait vers son propre archétype
Les modèles utilisés pour générer des cas d'exemple (études de cas, maquettes de formation, matériel pédagogique) renforcent systématiquement les stéréotypes. Un clinicien utilisant un LLM pour un brainstorming reçoit une liste d'idées filtrée par le biais — par exemple, toujours une femme pour l'anxiété, toujours un homme pour le NPD.
Les patients atypiques deviennent invisibles
Un homme avec un GAD, une femme avec un NPD — les modèles ne les « voient » tout simplement pas
Si les modèles génèrent 100 % de patients masculins pour le NPD et 100 % de patientes féminines pour le GAD (Opus, Grok), leur « vocabulaire patient » exclut les cas réels du genre non dominant. Cela a de l'importance pour les résumés de séance assistés par IA, les suggestions diagnostiques ou l'étiquetage automatique.
Le choix du modèle compte
Pour des tâches pédagogiques, préférez un modèle « diversifié » à un modèle « concentré »
Si l'objectif est la diversité des exemples (par exemple, un matériel de formation qui montre l'étendue des patients) — choisissez Gemini 3.1 Pro ou Grok-4 Fast. Si l'objectif est un patient prototype « scolaire » (par exemple, un cas pour tester une interface) — choisissez Claude Opus ou DeepSeek (mode le plus fort).
| Objectif | Modèle recommandé | Pourquoi |
|---|---|---|
| Matériel de formation | Gemini 3.1 Pro · Grok-4 | Plus grande diversité de prénoms et d'âges |
| Test d'interface / données factices | DeepSeek · Claude Opus | Archétypes stables, « modaux » |
| Ensembles équilibrés par genre | Grok-4 Fast | 52 % F / 48 % H au total |
| Recherche sensible à la diversité | Combinez les sorties de 3 modèles ou plus | Les différents biais s'annulent |
Mesures d'atténuation lors du travail avec des LLM
Des techniques concrètes de prompting et de validation qui réduisent le biais
- Forcez la variation démographique dans le prompt : « Génère une patiente de 22 ans atteinte de NPD » plutôt qu'un « génère un patient atteint de NPD » ouvert.
- Utilisez des seeds / plusieurs appels : générez 5 à 10 candidats et échantillonnez au hasard plutôt que de prendre le premier.
- Combinez les réponses de plusieurs modèles : un agrégat de Gemini + Grok + DeepSeek donne une distribution beaucoup plus large qu'un seul modèle.
- Auditez la sortie : une fois par trimestre — générez N=100 réponses et vérifiez la distribution du sexe, de l'âge, des noms de famille. Les schémas évoluent à chaque nouvelle version de modèle.
Données sources et réplication
Les 240 réponses brutes sont disponibles sur demande. Les scripts de réplication le sont également.
| Élément | Valeur |
|---|---|
| Total des requêtes | 240 (6 modèles × 4 troubles × 10 répétitions) |
| Température | 0,9 |
| Tokens max | 60 (200 pour GPT-5.5, 2000 pour Gemini 3.1) |
| Mode d'appel | HTTPS POST vers l'API OpenRouter, en parallèle (asyncio + httpx) |
| Concurrence | 20 (sémaphore) |
| Temps réel | ~3 min pour 240 appels |
| Langue | Polonais (prompt et sortie attendue) |
| Classification du genre | Heuristique : prénom se terminant par « a » → femme, sinon → homme (typique du polonais) |
Limites de l'étude
- Petit échantillon par cellule : 10 répétitions, c'est trop peu pour une significativité statistique stricte. Les résultats décrivent une tendance, pas une preuve.
- Heuristique de genre : la classification par terminaison du prénom est imparfaite (par ex. « Kuba », « Bonifacy »). En pratique, elle fonctionne à >95 % pour les prénoms polonais.
- Seulement 4 troubles : pour une image plus complète, il faudrait étendre au trouble borderline, au TDAH, à la schizophrénie, au TSPT, à l'autisme.
- Uniquement le contexte polonais : le biais peut se présenter très différemment pour des patients anglais, allemands ou espagnols.
- Instantané temporel : les résultats sont valables pour les versions de modèles d'avril 2026. Après des mises à jour des modèles, les schémas peuvent évoluer.
Téléchargez les données brutes (19 Ko)
Laissez votre email — nous vous enverrons le ZIP : les 240 réponses LLM (results.json), les rapports agrégés (final_report.md, per_model_report.md) et les scripts Python pour reproduire l'expérience.
CC-BY 4.0 · Sans paywall · Sans relance commerciale.