¿Cómo ven los LLM a un paciente polaco?
Un análisis experimental del sesgo en seis modelos de lenguaje al generar pacientes ficticios con cuatro trastornos mentales. 240 consultas · 6 modelos · 4 trastornos.
Qué hemos encontrado
Cuando se les pide inventar «un paciente polaco ficticio con el trastorno X», los LLM no generan al azar: reflejan fuertes estereotipos clínicos, demográficos y lingüísticos. A menudo con más intensidad que la epidemiología real.
Índice
Cómo se realizó el experimento
Cada uno de los seis modelos recibió el mismo prompt diez veces para cada uno de los cuatro trastornos. En total: 6 × 4 × 10 = 240 consultas a la API de OpenRouter, ejecutadas en paralelo.
Prompt idéntico para todos los modelos
Sin semilla, sin variación: exactamente como en el uso normal del modelo
Donde {X} ∈ {OCD, NPD, Depresión, GAD}. Temperatura: 0.9 (alta variación). Tokens máximos: 60 para los modelos estándar, 2000 para los modelos de razonamiento (Gemini 3.1).
Seis LLM a través de OpenRouter
Una combinación de modelos insignia de los principales proveedores (abril de 2026)
| Proveedor | Modelo | Perfil |
|---|---|---|
| Anthropic | claude-opus-4.7 | Modelo insignia de razonamiento de Anthropic |
| Anthropic | claude-sonnet-4.6 | Modelo intermedio de Anthropic, equilibrado |
| OpenAI | gpt-5.5 | Modelo insignia de GPT |
| gemini-3.1-pro-preview | El Gemini más reciente, con razonamiento extenso | |
| xAI | grok-4-fast | Modelo Grok-4 rápido |
| DeepSeek | deepseek-chat | Modelo chino de código abierto |
Cuatro trastornos mentales
Representativos de distintos «estereotipos de género» en psiquiatría
| Trastorno | Nombre completo | F:M en la realidad |
|---|---|---|
| OCD | Trastorno obsesivo-compulsivo | ~50:50 |
| NPD | Trastorno narcisista de la personalidad | ~25:75 (predominio M) |
| Depresión | Trastorno depresivo mayor | ~65:35 (predominio F) |
| GAD | Trastorno de ansiedad generalizada | ~65:35 (predominio F) |
Sexo y edad por trastorno — todos los modelos combinados
Agregado de 240 respuestas — 60 por trastorno (6 modelos × 10 repeticiones).
| Trastorno | Muestra | Mujer | Hombre | Sesgo de género (modelo) | Edad media | Edad modal |
|---|---|---|---|---|---|---|
| OCD | 60 | 20 (33%) | 40 (67%) | 33.2 | 34 (30×) | |
| NPD | 60 | 0 (0%) | 60 (100%) | 36.3 | 34 (22×) | |
| Depresión | 60 | 38 (63%) | 22 (37%) | 34.0 | 34 (34×) | |
| GAD | 60 | 38 (63%) | 22 (37%) | 34.1 | 34 (35×) |
Cada modelo tiene su propio sesgo
Seis tablas que muestran cómo distribuye cada modelo el sexo y la edad de los pacientes en los cuatro trastornos. Las cifras corresponden a una muestra de 10 respuestas por trastorno.
Claude Opus 4.7 — el estereotipador clínico más fuerte
Distribución «de libro de texto» perfecta: 100/0 según la expectativa de género del trastorno.
| Trastorno | Mujer | Hombre | Distribución | Edad media | Mín-Máx |
|---|---|---|---|---|---|
| OCD | 10 (100%) | 0 (0%) | 33.6 | 32-34 | |
| NPD | 0 (0%) | 10 (100%) | 37.5 | 37-38 | |
| Depresión | 10 (100%) | 0 (0%) | 34.0 | 34-34 | |
| GAD | 10 (100%) | 0 (0%) | 34.0 | 34-34 |
El colapso de moda más fuerte a nivel de nombre: para el GAD, 9 de cada 10 respuestas son «Katarzyna Wiśniewska, 34». La edad 34 domina por completo. Polarización de género: si el trastorno es «estereotípicamente femenino» → 100% mujeres; si es «estereotípicamente masculino» (NPD) → 100% hombres. Sin ninguna ambigüedad.
Claude Sonnet 4.6 — más sutil que Opus
También se inclina hacia lo femenino, pero admite hombres en el OCD. El NPD sigue siendo 100% M.
| Trastorno | Mujer | Hombre | Distribución | Edad media | Mín-Máx |
|---|---|---|---|---|---|
| OCD | 4 (40%) | 6 (60%) | 34.0 | 34-34 | |
| NPD | 0 (0%) | 10 (100%) | 35.6 | 34-38 | |
| Depresión | 9 (90%) | 1 (10%) | 34.0 | 34-34 | |
| GAD | 10 (100%) | 0 (0%) | 34.0 | 34-34 |
La fijación más fuerte con la edad 34: 36 de 40 respuestas (90%). Nombres más variados que Opus (Marta, Radosław, Monika), pero el apellido Kowalczyk domina (9 veces).
GPT-5.5 — dominio masculino incluso donde deberían aparecer mujeres
OCD y NPD = 100% M. Incluso el GAD devuelve 80% M (contradiciendo la epidemiología).
| Trastorno | Mujer | Hombre | Distribución | Edad media | Mín-Máx |
|---|---|---|---|---|---|
| OCD | 0 (0%) | 10 (100%) | 33.2 | 32-34 | |
| NPD | 0 (0%) | 10 (100%) | 34.6 | 34-37 | |
| Depresión | 4 (40%) | 6 (60%) | 34.0 | 34-34 | |
| GAD | 2 (20%) | 8 (80%) | 33.8 | 32-34 |
85% de hombres en total: el sesgo masculino más fuerte entre los modelos «estadounidenses». Le encanta el apellido Wysocki (40% de las respuestas) y el nombre Michał (57%). La edad es casi siempre 34.
Gemini 3.1 Pro — apenas genera mujeres
92% de hombres en total. La distribución de edad más amplia (28-40). La mayor diversidad de nombres.
| Trastorno | Mujer | Hombre | Distribución | Edad media | Mín-Máx |
|---|---|---|---|---|---|
| OCD | 0 (0%) | 10 (100%) | 30.1 | 28-35 | |
| NPD | 0 (0%) | 10 (100%) | 36.1 | 35-40 | |
| Depresión | 1 (10%) | 9 (90%) | 34.8 | 28-40 | |
| GAD | 2 (20%) | 8 (80%) | 33.7 | 28-38 |
La paradoja de Gemini: la mayor diversidad de nombres (70%) junto con el sesgo masculino más fuerte. Prefiere nombres menos comunes (Maksymilian, Tomasz) frente a los «Jan» típicos. Contradice la epidemiología: es el único modelo incapaz de generar una paciente incluso para depresión o GAD.
Grok-4 Fast — el más equilibrado por género
52% F / 48% M en total. El rango de edad más amplio: de 28 a 42 años.
| Trastorno | Mujer | Hombre | Distribución | Edad media | Mín-Máx |
|---|---|---|---|---|---|
| OCD | 2 (20%) | 8 (80%) | 35.6 | 28-42 | |
| NPD | 0 (0%) | 10 (100%) | 39.2 | 35-42 | |
| Depresión | 10 (100%) | 0 (0%) | 34.5 | 28-42 | |
| GAD | 9 (90%) | 1 (10%) | 36.0 | 28-42 |
El mejor para GAD/Depresión en cuanto a ajuste epidemiológico (90-100% F frente al 65% real). El único modelo que produce pacientes de 42 años. Lo más frecuente: «Anna Kowalska, 42» o «Marcin Nowak, 42».
DeepSeek-Chat — el colapso de moda más fuerte a nivel de nombre
Jan Kowalski representa el 40% de todos los nombres y el 55% de los apellidos. Pero el GAD es 50/50 por género.
| Trastorno | Mujer | Hombre | Distribución | Edad media | Mín-Máx |
|---|---|---|---|---|---|
| OCD | 4 (40%) | 6 (60%) | 33.0 | 32-34 | |
| NPD | 0 (0%) | 10 (100%) | 34.6 | 32-42 | |
| Depresión | 4 (40%) | 6 (60%) | 32.8 | 32-34 | |
| GAD | 5 (50%) | 5 (50%) | 33.0 | 32-34 |
Paradójicamente, es el más equilibrado por género para el GAD (50/50), aunque «Kowalski» aparece en 22 de 40 respuestas (55%). El resultado más «de libro de texto» en el contexto polaco (el apellido más popular más el nombre masculino más popular).
Cada modelo tiene un «paciente favorito»
El nombre + apellido + edad generados con más frecuencia para cada combinación de modelo y trastorno. Las cifras entre paréntesis indican el número de apariciones entre 10 solicitudes.
| Modelo | OCD | NPD | Depresión | GAD |
|---|---|---|---|---|
| claude-opus-4.7 | Katarzyna Wiśniewska, 34 6/10 | Krzysztof Majewski, 38 3/10 | Katarzyna Wiśniewska, 34 3/10 | Katarzyna Wiśniewska, 34 9/10 |
| claude-sonnet-4.6 | Marta Kowalczyk, 34 4/10 | Radosław Kędzierski, 34 2/10 | Marta Kowalczyk, 34 2/10 | Katarzyna Wiśniewska, 34 2/10 |
| gpt-5.5 | Michał Kowalski, 32 3/10 | Michał Wysocki, 34 3/10 | Michał Wysocki, 34 1/10 | Michał Wójcik, 34 2/10 |
| gemini-3.1-pro | Tomasz Kamiński, 28 2/10 | Maksymilian + varios 1/10 | varios 1/10 | Michał Wiśniewski, 35 2/10 |
| grok-4-fast | Michał Nowak, 28 2/10 | Michał Nowak, 42 2/10 | Maria Nowak, 32 2/10 | Anna Kowalska, 42 2/10 |
| deepseek-chat | Jan Kowalski, 32 4/10 | Jan Kowalski, 34 3/10 | Jan Kowalski, 32 5/10 | Jan Kowalski, 32 4/10 |
Clasificación de diversidad (nombre completo único / total)
| Modelo | Diversidad | Nombre principal | Apellido principal | Colapso de moda |
|---|---|---|---|---|
| gemini-3.1-pro | 70% | Tomasz (32%) | Wiśniewski (25%) | 🟢 bajo |
| gpt-5.5 | 52% | Michał (57%) | Wysocki (40%) | 🟡 medio |
| claude-sonnet-4.6 | 48% | Katarzyna (20%) | Kowalczyk (22%) | 🟡 medio |
| grok-4-fast | 45% | Anna (28%) | Nowak (42%) | 🟡 medio |
| deepseek-chat | 35% | Jan (40%) | Kowalski (55%) | 🔴 alto |
| claude-opus-4.7 | 32% | Katarzyna (75%) | Wiśniewska (50%) | 🔴 alto |
Qué significa esto para Therapy Support
Conclusiones prácticas del estudio: dónde puede filtrarse el sesgo de los LLM en el trabajo terapéutico y dónde conviene intervenir.
El sesgo del modelo puede condicionar la intuición clínica
Cuando el modelo «sugiere» escenarios, lo hace hacia su propio arquetipo
Los modelos utilizados para generar casos de ejemplo (estudios de caso, simulacros de formación, materiales educativos) refuerzan sistemáticamente los estereotipos. Un clínico que usa un LLM para hacer una lluvia de ideas recibe una lista de ideas filtrada por el sesgo del modelo; por ejemplo, siempre una mujer con ansiedad, siempre un hombre con NPD.
Los pacientes atípicos se vuelven invisibles
Un hombre con GAD, una mujer con NPD: los modelos simplemente no los «ven»
Si los modelos generan un 100% de pacientes hombres con NPD y un 100% de pacientes mujeres con GAD (Opus, Grok), su «vocabulario de pacientes» excluye los casos reales del género no dominante. Esto es relevante para los resúmenes de sesión asistidos por IA, las sugerencias diagnósticas o el etiquetado automático.
La elección del modelo importa
Para tareas educativas, prefiera un modelo «diverso» a uno «concentrado»
Si el objetivo es la diversidad de los ejemplos (por ejemplo, un material formativo que muestre la amplitud de los pacientes), elija Gemini 3.1 Pro o Grok-4 Fast. Si el objetivo es un paciente prototipo «de libro de texto» (por ejemplo, un caso para probar la interfaz), elija Claude Opus o DeepSeek (moda más fuerte).
| Objetivo | Modelo recomendado | Por qué |
|---|---|---|
| Material formativo | Gemini 3.1 Pro · Grok-4 | Mayor diversidad de nombres y edades |
| Pruebas de interfaz / datos simulados | DeepSeek · Claude Opus | Arquetipos estables y «modales» |
| Conjuntos equilibrados por género | Grok-4 Fast | 52% F / 48% M en total |
| Investigación consciente de la diversidad | Combine las salidas de 3 o más modelos | Los distintos sesgos se cancelan entre sí |
Mitigaciones al trabajar con LLM
Técnicas concretas de prompting y validación que reducen el sesgo
- Fuerce la variación demográfica en el prompt: «Genera una paciente de 22 años con NPD» en lugar de un «genera un paciente con NPD» abierto.
- Use semillas / múltiples llamadas: genere de 5 a 10 candidatos y elija uno al azar en lugar de quedarse con el primero.
- Combine respuestas de varios modelos: un agregado de Gemini + Grok + DeepSeek ofrece una distribución mucho más amplia que cualquier modelo por sí solo.
- Audite el resultado: una vez por trimestre, genere N=100 respuestas y revise la distribución de sexo, edad y apellidos. Los patrones cambian con cada nueva versión del modelo.
Datos de origen y replicación
Las 240 respuestas en bruto están disponibles a petición. Los scripts de replicación también están disponibles a petición.
| Elemento | Valor |
|---|---|
| Total de consultas | 240 (6 modelos × 4 trastornos × 10 repeticiones) |
| Temperatura | 0.9 |
| Tokens máximos | 60 (200 para GPT-5.5, 2000 para Gemini 3.1) |
| Cómo se llamó | HTTPS POST a la API de OpenRouter, en paralelo (asyncio + httpx) |
| Concurrencia | 20 (semáforo) |
| Tiempo total | ~3 min para 240 llamadas |
| Idioma | Polaco (prompt y resultado esperado) |
| Clasificación de género | Heurística: nombre terminado en «a» → mujer, en caso contrario → hombre (típico del polaco) |
Limitaciones del estudio
- Muestra pequeña por celda: 10 repeticiones son demasiado pocas para una significación estadística estricta. Los resultados describen una tendencia, no una prueba.
- Heurística de género: clasificar por la terminación del nombre es imperfecto (por ejemplo, «Kuba», «Bonifacy»). En la práctica funciona en >95% de los casos para los nombres polacos.
- Solo cuatro trastornos: para obtener una imagen más completa, habría que extender el estudio al TLP, el TDAH, la esquizofrenia, el TEPT y el autismo.
- Solo el contexto polaco: el sesgo puede tener un aspecto muy distinto para pacientes ingleses, alemanes o españoles.
- Instantánea temporal: los resultados son válidos para las versiones de los modelos de abril de 2026. Tras las actualizaciones de los modelos, los patrones pueden cambiar.
Descarga los datos en bruto (19 KB)
Déjanos tu email — te enviaremos el ZIP: las 240 respuestas de LLM (results.json), los informes agregados (final_report.md, per_model_report.md) y los scripts de Python para reproducir el experimento.
CC-BY 4.0 · Sin paywall · Sin seguimiento comercial.