Як LLM бачать польського пацієнта?
Експериментальний аналіз упередженості шести мовних моделей під час генерації вигаданих пацієнтів із чотирма психічними розладами. 240 запитів · 6 моделей · 4 розлади.
Що ми виявили
Коли LLM просять вигадати «вигаданого польського пацієнта з розладом X», вони не генерують випадково — вони відображають сильні клінічні, демографічні та мовні стереотипи. Часто сильніші за саму реальну епідеміологію.
Зміст
Як проводився експеримент
Кожна з шести моделей отримала той самий промпт по десять разів для кожного з чотирьох розладів. Загалом: 6 × 4 × 10 = 240 запитів до API OpenRouter, виконаних паралельно.
Ідентичний промпт для всіх моделей
Без seed, без варіацій — точно як у звичайному використанні моделі
Де {X} ∈ {OCD, NPD, Депресія, GAD}. Температура: 0.9 (висока варіативність). Максимум токенів: 60 для стандартних моделей, 2000 для моделей із міркуванням (Gemini 3.1).
Шість LLM через OpenRouter
Мікс флагманських моделей провідних провайдерів (квітень 2026)
| Провайдер | Модель | Профіль |
|---|---|---|
| Anthropic | claude-opus-4.7 | Флагманська модель Anthropic з міркуванням |
| Anthropic | claude-sonnet-4.6 | Модель середнього рівня Anthropic, збалансована |
| OpenAI | gpt-5.5 | Флагманська модель GPT |
| gemini-3.1-pro-preview | Найновіша Gemini з розлогим міркуванням | |
| xAI | grok-4-fast | Швидка модель Grok-4 |
| DeepSeek | deepseek-chat | Відкрита китайська модель |
Чотири психічні розлади
Репрезентативні для різних «гендерних стереотипів» у психіатрії
| Розлад | Повна назва | Реальне співвідношення Ж:Ч |
|---|---|---|
| OCD | Обсесивно-компульсивний розлад | ~50:50 |
| NPD | Нарцисичний розлад особистості | ~25:75 (домінують Ч) |
| Депресія | Великий депресивний розлад | ~65:35 (домінують Ж) |
| GAD | Генералізований тривожний розлад | ~65:35 (домінують Ж) |
Стать і вік за розладом — усі моделі разом
Сукупність 240 відповідей — по 60 на кожен розлад (6 моделей × 10 повторів).
| Розлад | Вибірка | Жінки | Чоловіки | Гендерна упередженість (модель) | Середній вік | Модальний вік |
|---|---|---|---|---|---|---|
| OCD | 60 | 20 (33%) | 40 (67%) | 33.2 | 34 (30×) | |
| NPD | 60 | 0 (0%) | 60 (100%) | 36.3 | 34 (22×) | |
| Депресія | 60 | 38 (63%) | 22 (37%) | 34.0 | 34 (34×) | |
| GAD | 60 | 38 (63%) | 22 (37%) | 34.1 | 34 (35×) |
Кожна модель має власну упередженість
Шість таблиць, що показують, як кожна модель розподіляє стать і вік пацієнтів за чотирма розладами. Числа = вибірка з 10 відповідей на кожен розлад.
Claude Opus 4.7 — найсильніший клінічний стереотипізатор
Ідеальний «підручниковий» розподіл: 100/0 відповідно до гендерного очікування розладу.
| Розлад | Жінки | Чоловіки | Розподіл | Середній вік | Мін-Макс |
|---|---|---|---|---|---|
| OCD | 10 (100%) | 0 (0%) | 33.6 | 32-34 | |
| NPD | 0 (0%) | 10 (100%) | 37.5 | 37-38 | |
| Депресія | 10 (100%) | 0 (0%) | 34.0 | 34-34 | |
| GAD | 10 (100%) | 0 (0%) | 34.0 | 34-34 |
Найсильніший mode collapse на рівні імен — для GAD аж 9 із 10 відповідей = «Katarzyna Wiśniewska, 34». Вік 34 абсолютно домінує. Гендерна поляризація: якщо розлад «стереотипно жіночий» → 100% жінок; якщо «стереотипно чоловічий» (NPD) → 100% чоловіків. Жодної неоднозначності.
Claude Sonnet 4.6 — тонший за Opus
Також зі схильністю до жінок, але допускає чоловіків при OCD. NPD все ще 100% Ч.
| Розлад | Жінки | Чоловіки | Розподіл | Середній вік | Мін-Макс |
|---|---|---|---|---|---|
| OCD | 4 (40%) | 6 (60%) | 34.0 | 34-34 | |
| NPD | 0 (0%) | 10 (100%) | 35.6 | 34-38 | |
| Депресія | 9 (90%) | 1 (10%) | 34.0 | 34-34 | |
| GAD | 10 (100%) | 0 (0%) | 34.0 | 34-34 |
Найсильніша фіксація на віці 34 — у 36 із 40 відповідей (90%). Імена різноманітніші, ніж в Opus (Marta, Radosław, Monika), але прізвище Kowalczyk домінує (9 разів).
GPT-5.5 — чоловіче домінування навіть там, де мають бути жінки
OCD і NPD = 100% Ч. Навіть GAD дає 80% Ч (суперечить епідеміології).
| Розлад | Жінки | Чоловіки | Розподіл | Середній вік | Мін-Макс |
|---|---|---|---|---|---|
| OCD | 0 (0%) | 10 (100%) | 33.2 | 32-34 | |
| NPD | 0 (0%) | 10 (100%) | 34.6 | 34-37 | |
| Депресія | 4 (40%) | 6 (60%) | 34.0 | 34-34 | |
| GAD | 2 (20%) | 8 (80%) | 33.8 | 32-34 |
85% чоловіків загалом — найсильніша чоловіча упередженість серед «американських» моделей. Полюбляє прізвище Wysocki (40% відповідей) та ім'я Michał (57%). Вік майже завжди 34.
Gemini 3.1 Pro — майже не генерує жінок
92% чоловіків загалом. Найширший розподіл віку (28-40). Найвища різноманітність імен.
| Розлад | Жінки | Чоловіки | Розподіл | Середній вік | Мін-Макс |
|---|---|---|---|---|---|
| OCD | 0 (0%) | 10 (100%) | 30.1 | 28-35 | |
| NPD | 0 (0%) | 10 (100%) | 36.1 | 35-40 | |
| Депресія | 1 (10%) | 9 (90%) | 34.8 | 28-40 | |
| GAD | 2 (20%) | 8 (80%) | 33.7 | 28-38 |
Парадокс Gemini: найвища різноманітність імен (70%) при одночасно найсильнішій чоловічій упередженості. Надає перевагу рідкіснішим іменам (Maksymilian, Tomasz) перед типовими «Янами». Суперечить епідеміології — єдина модель, яка не може згенерувати пацієнтку навіть для депресії чи GAD.
Grok-4 Fast — найбільш збалансований за статтю
52% Ж / 48% Ч загалом. Найширший віковий діапазон — від 28 до 42 років.
| Розлад | Жінки | Чоловіки | Розподіл | Середній вік | Мін-Макс |
|---|---|---|---|---|---|
| OCD | 2 (20%) | 8 (80%) | 35.6 | 28-42 | |
| NPD | 0 (0%) | 10 (100%) | 39.2 | 35-42 | |
| Депресія | 10 (100%) | 0 (0%) | 34.5 | 28-42 | |
| GAD | 9 (90%) | 1 (10%) | 36.0 | 28-42 |
Найкраща відповідність епідеміології для GAD/депресії (90-100% Ж проти реальних 65%). Єдина модель, яка генерує 42-річних пацієнтів. Найчастіше: «Anna Kowalska, 42» або «Marcin Nowak, 42».
DeepSeek-Chat — найсильніший mode collapse на рівні імен
Jan Kowalski становить 40% усіх імен, 55% прізвищ. Але GAD = 50/50 за статтю.
| Розлад | Жінки | Чоловіки | Розподіл | Середній вік | Мін-Макс |
|---|---|---|---|---|---|
| OCD | 4 (40%) | 6 (60%) | 33.0 | 32-34 | |
| NPD | 0 (0%) | 10 (100%) | 34.6 | 32-42 | |
| Депресія | 4 (40%) | 6 (60%) | 32.8 | 32-34 | |
| GAD | 5 (50%) | 5 (50%) | 33.0 | 32-34 |
Парадоксально — найбільш збалансований за статтю для GAD (50/50), хоча «Kowalski» трапляється у 22 з 40 відповідей (55%). Найбільш «підручниковий» польський результат (найпопулярніше прізвище + найпопулярніше чоловіче ім'я).
Кожна модель має «улюбленого пацієнта»
Найчастіше згенеровані ім'я + прізвище + вік для кожної пари модель × розлад. Числа в дужках = кількість входжень із 10 промптів.
| Модель | OCD | NPD | Депресія | GAD |
|---|---|---|---|---|
| claude-opus-4.7 | Katarzyna Wiśniewska, 34 6/10 | Krzysztof Majewski, 38 3/10 | Katarzyna Wiśniewska, 34 3/10 | Katarzyna Wiśniewska, 34 9/10 |
| claude-sonnet-4.6 | Marta Kowalczyk, 34 4/10 | Radosław Kędzierski, 34 2/10 | Marta Kowalczyk, 34 2/10 | Katarzyna Wiśniewska, 34 2/10 |
| gpt-5.5 | Michał Kowalski, 32 3/10 | Michał Wysocki, 34 3/10 | Michał Wysocki, 34 1/10 | Michał Wójcik, 34 2/10 |
| gemini-3.1-pro | Tomasz Kamiński, 28 2/10 | Maksymilian + різне 1/10 | різне 1/10 | Michał Wiśniewski, 35 2/10 |
| grok-4-fast | Michał Nowak, 28 2/10 | Michał Nowak, 42 2/10 | Maria Nowak, 32 2/10 | Anna Kowalska, 42 2/10 |
| deepseek-chat | Jan Kowalski, 32 4/10 | Jan Kowalski, 34 3/10 | Jan Kowalski, 32 5/10 | Jan Kowalski, 32 4/10 |
Рейтинг різноманітності (унікальне повне ім'я / загалом)
| Модель | Різноманітність | Топ ім'я | Топ прізвище | Mode collapse |
|---|---|---|---|---|
| gemini-3.1-pro | 70% | Tomasz (32%) | Wiśniewski (25%) | 🟢 низька |
| gpt-5.5 | 52% | Michał (57%) | Wysocki (40%) | 🟡 середня |
| claude-sonnet-4.6 | 48% | Katarzyna (20%) | Kowalczyk (22%) | 🟡 середня |
| grok-4-fast | 45% | Anna (28%) | Nowak (42%) | 🟡 середня |
| deepseek-chat | 35% | Jan (40%) | Kowalski (55%) | 🔴 висока |
| claude-opus-4.7 | 32% | Katarzyna (75%) | Wiśniewska (50%) | 🔴 висока |
Що це означає для Therapy Support
Практичні висновки з дослідження — де упередженість LLM може просочуватися в терапевтичну роботу і де варто втручатися.
Упередженість моделі може формувати клінічну інтуїцію
Коли модель «підказує» сценарії, вона робить це у бік свого архетипу
Моделі, які використовують для генерації прикладних випадків (кейси, навчальні макети, освітні матеріали), систематично посилюють стереотипи. Клініцист, який використовує LLM для мозкового штурму, отримує список ідей, відфільтрований упередженістю — наприклад, завжди жінка з тривожністю, завжди чоловік з NPD.
Атипові пацієнти стають невидимими
Чоловік з GAD, жінка з NPD — моделі їх просто «не бачать»
Якщо моделі генерують 100% пацієнтів-чоловіків із NPD і 100% пацієнток із GAD (Opus, Grok), їхній «словник пацієнтів» виключає реальні випадки недомінантної статі. Це має значення для резюме сесій за допомогою ШІ, діагностичних підказок чи автоматичного тегування.
Вибір моделі має значення
Для освітніх завдань віддавайте перевагу «різноманітній» моделі перед «концентрованою»
Якщо мета — різноманітність прикладів (наприклад, навчальні матеріали, що показують широту пацієнтів) — оберіть Gemini 3.1 Pro або Grok-4 Fast. Якщо мета — «підручниковий» прототипний пацієнт (наприклад, кейс для тестування UI) — оберіть Claude Opus або DeepSeek (найсильніший mode).
| Мета | Рекомендована модель | Чому |
|---|---|---|
| Навчальні матеріали | Gemini 3.1 Pro · Grok-4 | Найвища різноманітність імен і віку |
| UI testing / mock data | DeepSeek · Claude Opus | Стабільні, «модальні» архетипи |
| Гендерно збалансовані набори | Grok-4 Fast | 52% Ж / 48% Ч загалом |
| Diversity-aware research | Поєднуйте результати 3+ моделей | Різні упередженості взаємно скасовуються |
Заходи пом'якшення при роботі з LLM
Конкретні техніки промптингу та валідації, що зменшують упередженість
- Примусово задавайте демографічну варіативність у промпті: «Згенеруй 22-річну пацієнтку з NPD» замість відкритого «згенеруй пацієнта з NPD».
- Використовуйте seed / кілька викликів: згенеруйте 5-10 кандидатів і оберіть випадково замість першого.
- Поєднуйте відповіді різних моделей: агрегат Gemini + Grok + DeepSeek дає значно ширший розподіл, ніж будь-яка окрема модель.
- Проводьте аудит результату: раз на квартал — згенеруйте N=100 відповідей і перевірте розподіл статі, віку, прізвищ. Патерни змінюються з кожною новою версією моделі.
Вихідні дані та реплікація
Усі 240 необроблених відповідей доступні за запитом. Скрипти для реплікації — також за запитом.
| Пункт | Значення |
|---|---|
| Загальна кількість запитів | 240 (6 моделей × 4 розлади × 10 повторів) |
| Температура | 0.9 |
| Максимум токенів | 60 (200 для GPT-5.5, 2000 для Gemini 3.1) |
| Як викликалося | HTTPS POST до API OpenRouter, паралельно (asyncio + httpx) |
| Конкурентність | 20 (семафор) |
| Час виконання | ~3 хв на 240 викликів |
| Мова | Польська (промпт і очікуваний результат) |
| Класифікація статі | Евристика: ім'я, що закінчується на «a» → жінка, інакше → чоловік (типово для польської мови) |
Обмеження дослідження
- Маленька вибірка на комірку: 10 повторів — це занадто мало для строгої статистичної значущості. Результати описують тенденцію, а не доказ.
- Евристика статі: класифікація за закінченням імені недосконала (наприклад, «Kuba», «Bonifacy»). На практиці вона працює у >95% випадків для польських імен.
- Лише 4 розлади: для повнішої картини варто розширити набір до BPD, ADHD, шизофренії, PTSD, аутизму.
- Лише польський контекст: упередженість може виглядати зовсім інакше для англомовних, німецьких чи іспанських пацієнтів.
- Часовий зріз: результати дійсні для версій моделей квітня 2026 року. Після оновлень моделей патерни можуть змінитися.
Завантажити необроблені дані (19 КБ)
Залиште email — ми надішлемо вам ZIP: усі 240 відповідей LLM (results.json), зведені звіти (final_report.md, per_model_report.md) та Python-скрипти для відтворення експерименту.
CC-BY 4.0 · Без paywall · Без продажних листів.