Как LLM моделите виждат полски пациент?
Експериментален анализ на пристрастия при шест езикови модела при генериране на фиктивни пациенти с четири психични разстройства. 240 заявки · 6 модела · 4 разстройства.
Какво открихме
Когато бъдат помолени да измислят „фиктивен полски пациент с разстройство X“, LLM моделите не генерират произволно — те отразяват силни клинични, демографски и езикови стереотипи. Често по-силно от реалната епидемиология.
Съдържание
Как беше проведен експериментът
Всеки от шестте модела получи един и същ промпт по десет пъти за всяко от четирите разстройства. Общо: 6 × 4 × 10 = 240 заявки към OpenRouter API, изпълнени паралелно.
Идентичен промпт за всички модели
Без seed, без вариация — точно както при нормална употреба на модела
Където {X} ∈ {ОКР, НРЛ, Депресия, ГТР}. Температура: 0.9 (висока вариация). Максимум токени: 60 за стандартните модели, 2000 за разсъждаващите модели (Gemini 3.1).
Шест LLM модела през OpenRouter
Микс от флагмански модели от водещи доставчици (април 2026)
| Доставчик | Модел | Профил |
|---|---|---|
| Anthropic | claude-opus-4.7 | Флагмански разсъждаващ модел на Anthropic |
| Anthropic | claude-sonnet-4.6 | Среден модел на Anthropic, балансиран |
| OpenAI | gpt-5.5 | Флагмански модел GPT |
| gemini-3.1-pro-preview | Най-новият Gemini с разширено разсъждение | |
| xAI | grok-4-fast | Бърз модел Grok-4 |
| DeepSeek | deepseek-chat | Отворен китайски модел |
Четири психични разстройства
Представителни за различни „полови стереотипи“ в психиатрията
| Разстройство | Пълно наименование | Реално съотношение Ж:М |
|---|---|---|
| ОКР | Обсесивно-компулсивно разстройство | ~50:50 |
| НРЛ | Нарцистично разстройство на личността | ~25:75 (доминират М) |
| Депресия | Голямо депресивно разстройство | ~65:35 (доминират Ж) |
| ГТР | Генерализирано тревожно разстройство | ~65:35 (доминират Ж) |
Пол и възраст по разстройство — всички модели заедно
Обобщение на 240 отговора — по 60 за всяко разстройство (6 модела × 10 повторения).
| Разстройство | Извадка | Жени | Мъже | Полово пристрастие (модел) | Средна възраст | Модална възраст |
|---|---|---|---|---|---|---|
| ОКР | 60 | 20 (33%) | 40 (67%) | 33.2 | 34 (30×) | |
| НРЛ | 60 | 0 (0%) | 60 (100%) | 36.3 | 34 (22×) | |
| Депресия | 60 | 38 (63%) | 22 (37%) | 34.0 | 34 (34×) | |
| ГТР | 60 | 38 (63%) | 22 (37%) | 34.1 | 34 (35×) |
Всеки модел има собствено пристрастие
Шест таблици, показващи как всеки модел разпределя пола и възрастта на пациентите за четирите разстройства. Числата = извадка от 10 отговора за всяко разстройство.
Claude Opus 4.7 — най-силният клиничен стереотипизатор
Идеално „учебниково“ разпределение: 100/0 в съответствие с половото очакване на разстройството.
| Разстройство | Жени | Мъже | Разпределение | Средна възраст | Мин-Макс |
|---|---|---|---|---|---|
| ОКР | 10 (100%) | 0 (0%) | 33.6 | 32-34 | |
| НРЛ | 0 (0%) | 10 (100%) | 37.5 | 37-38 | |
| Депресия | 10 (100%) | 0 (0%) | 34.0 | 34-34 | |
| ГТР | 10 (100%) | 0 (0%) | 34.0 | 34-34 |
Най-силен колапс на модата на ниво име — за ГТР цели 9 от 10 отговора = „Katarzyna Wiśniewska, 34“. Възраст 34 доминира напълно. Полова поляризация: ако разстройството е „стереотипно женско“ → 100% жени; ако е „стереотипно мъжко“ (НРЛ) → 100% мъже. Нула двусмисленост.
Claude Sonnet 4.6 — по-фин от Opus
Също с наклон към жени, но допуска мъже при ОКР. НРЛ остава 100% М.
| Разстройство | Жени | Мъже | Разпределение | Средна възраст | Мин-Макс |
|---|---|---|---|---|---|
| ОКР | 4 (40%) | 6 (60%) | 34.0 | 34-34 | |
| НРЛ | 0 (0%) | 10 (100%) | 35.6 | 34-38 | |
| Депресия | 9 (90%) | 1 (10%) | 34.0 | 34-34 | |
| ГТР | 10 (100%) | 0 (0%) | 34.0 | 34-34 |
Най-силна фиксация върху възраст 34 — 36 от 40 отговора (90%). По-разнообразни собствени имена от Opus (Marta, Radosław, Monika), но фамилията Kowalczyk доминира (9 пъти).
GPT-5.5 — мъжка доминация дори там, където би трябвало да има жени
ОКР и НРЛ = 100% М. Дори ГТР дава 80% М (в противоречие с епидемиологията).
| Разстройство | Жени | Мъже | Разпределение | Средна възраст | Мин-Макс |
|---|---|---|---|---|---|
| ОКР | 0 (0%) | 10 (100%) | 33.2 | 32-34 | |
| НРЛ | 0 (0%) | 10 (100%) | 34.6 | 34-37 | |
| Депресия | 4 (40%) | 6 (60%) | 34.0 | 34-34 | |
| ГТР | 2 (20%) | 8 (80%) | 33.8 | 32-34 |
85% мъже общо — най-силното мъжко пристрастие сред „американските“ модели. Предпочита фамилията Wysocki (40% от отговорите) и името Michał (57%). Възрастта почти винаги е 34.
Gemini 3.1 Pro — почти не генерира жени
92% мъже общо. Най-широко разпределение на възрастта (28-40). Най-висока разнообразност на имената.
| Разстройство | Жени | Мъже | Разпределение | Средна възраст | Мин-Макс |
|---|---|---|---|---|---|
| ОКР | 0 (0%) | 10 (100%) | 30.1 | 28-35 | |
| НРЛ | 0 (0%) | 10 (100%) | 36.1 | 35-40 | |
| Депресия | 1 (10%) | 9 (90%) | 34.8 | 28-40 | |
| ГТР | 2 (20%) | 8 (80%) | 33.7 | 28-38 |
Парадоксът на Gemini: най-висока разнообразност на имената (70%), докато същевременно показва най-силно мъжко пристрастие. Предпочита по-редки имена (Maksymilian, Tomasz) пред типичните „Jan“. Противоречи на епидемиологията — единственият модел, който не може да генерира пациентка дори за депресия или ГТР.
Grok-4 Fast — най-балансиран по пол
52% Ж / 48% М общо. Най-широк възрастов диапазон — от 28 до 42.
| Разстройство | Жени | Мъже | Разпределение | Средна възраст | Мин-Макс |
|---|---|---|---|---|---|
| ОКР | 2 (20%) | 8 (80%) | 35.6 | 28-42 | |
| НРЛ | 0 (0%) | 10 (100%) | 39.2 | 35-42 | |
| Депресия | 10 (100%) | 0 (0%) | 34.5 | 28-42 | |
| ГТР | 9 (90%) | 1 (10%) | 36.0 | 28-42 |
Най-добър за ГТР/Депресия по отношение на съответствие с епидемиологията (90-100% Ж срещу реалните 65%). Единственият модел, който произвежда 42-годишни пациенти. Най-често срещано: „Anna Kowalska, 42“ или „Marcin Nowak, 42“.
DeepSeek-Chat — най-силен колапс на модата на ниво име
Jan Kowalski съставлява 40% от всички собствени имена, 55% от фамилиите. Но ГТР = 50/50 по пол.
| Разстройство | Жени | Мъже | Разпределение | Средна възраст | Мин-Макс |
|---|---|---|---|---|---|
| ОКР | 4 (40%) | 6 (60%) | 33.0 | 32-34 | |
| НРЛ | 0 (0%) | 10 (100%) | 34.6 | 32-42 | |
| Депресия | 4 (40%) | 6 (60%) | 32.8 | 32-34 | |
| ГТР | 5 (50%) | 5 (50%) | 33.0 | 32-34 |
Парадоксално — най-балансиран по пол за ГТР (50/50), въпреки че „Kowalski“ се среща в 22 от 40 отговора (55%). Най-„учебниковата“ полска изходна информация (най-популярна фамилия + най-популярно мъжко собствено име).
Всеки модел има „любим пациент“
Най-често генерираните собствено име + фамилия + възраст за всяка комбинация модел × разстройство. Числата в скоби = брой срещания от 10 заявки.
| Модел | ОКР | НРЛ | Депресия | ГТР |
|---|---|---|---|---|
| claude-opus-4.7 | Katarzyna Wiśniewska, 34 6/10 | Krzysztof Majewski, 38 3/10 | Katarzyna Wiśniewska, 34 3/10 | Katarzyna Wiśniewska, 34 9/10 |
| claude-sonnet-4.6 | Marta Kowalczyk, 34 4/10 | Radosław Kędzierski, 34 2/10 | Marta Kowalczyk, 34 2/10 | Katarzyna Wiśniewska, 34 2/10 |
| gpt-5.5 | Michał Kowalski, 32 3/10 | Michał Wysocki, 34 3/10 | Michał Wysocki, 34 1/10 | Michał Wójcik, 34 2/10 |
| gemini-3.1-pro | Tomasz Kamiński, 28 2/10 | Maksymilian + различни 1/10 | различни 1/10 | Michał Wiśniewski, 35 2/10 |
| grok-4-fast | Michał Nowak, 28 2/10 | Michał Nowak, 42 2/10 | Maria Nowak, 32 2/10 | Anna Kowalska, 42 2/10 |
| deepseek-chat | Jan Kowalski, 32 4/10 | Jan Kowalski, 34 3/10 | Jan Kowalski, 32 5/10 | Jan Kowalski, 32 4/10 |
Класация по разнообразие (уникално пълно име / общо)
| Модел | Разнообразие | Топ собствено име | Топ фамилия | Колапс на модата |
|---|---|---|---|---|
| gemini-3.1-pro | 70% | Tomasz (32%) | Wiśniewski (25%) | 🟢 ниско |
| gpt-5.5 | 52% | Michał (57%) | Wysocki (40%) | 🟡 средно |
| claude-sonnet-4.6 | 48% | Katarzyna (20%) | Kowalczyk (22%) | 🟡 средно |
| grok-4-fast | 45% | Anna (28%) | Nowak (42%) | 🟡 средно |
| deepseek-chat | 35% | Jan (40%) | Kowalski (55%) | 🔴 високо |
| claude-opus-4.7 | 32% | Katarzyna (75%) | Wiśniewska (50%) | 🔴 високо |
Какво означава това за TherapySupport
Практически изводи от изследването — къде пристрастието на LLM може да се промъкне в терапевтичната работа и къде си струва да се намеси.
Пристрастието на модела може да оформя клиничната интуиция
Когато моделът „предлага“ сценарии, той го прави в посока към собствения си архетип
Моделите, използвани за генериране на примерни случаи (казуси, обучителни макети, образователни материали), систематично затвърждават стереотипите. Клиницист, който използва LLM за брейнсторминг, получава филтриран през пристрастието списък с идеи — например винаги жена с тревожност, винаги мъж с НРЛ.
Атипичните пациенти стават невидими
Мъж с ГТР, жена с НРЛ — моделите просто не ги „виждат“
Ако моделите генерират 100% мъже пациенти с НРЛ и 100% жени пациенти с ГТР (Opus, Grok), техният „пациентски речник“ изключва реалните случаи на недоминиращия пол. Това има значение за AI-асистираните обобщения на сесии, диагностичните предложения или автоматичното таргетиране.
Изборът на модел има значение
За образователни задачи предпочитайте „разнообразен“ модел пред „концентриран“
Ако целта е разнообразие на примерите (напр. обучителен материал, показващ широтата на пациентите) — изберете Gemini 3.1 Pro или Grok-4 Fast. Ако целта е „учебников“ прототипен пациент (напр. случай за тестване на потребителски интерфейс) — изберете Claude Opus или DeepSeek (най-силна мода).
| Цел | Препоръчан модел | Защо |
|---|---|---|
| Обучителни материали | Gemini 3.1 Pro · Grok-4 | Най-високо разнообразие на имена и възрасти |
| Тестване на UI / фиктивни данни | DeepSeek · Claude Opus | Стабилни, „модални“ архетипи |
| Балансирани по пол набори | Grok-4 Fast | 52% Ж / 48% М общо |
| Изследване, съобразено с разнообразието | Комбинирайте резултати от 3+ модела | Различните пристрастия се неутрализират |
Смекчаване при работа с LLM
Конкретни техники за промптиране и валидиране, които намаляват пристрастието
- Наложете демографска вариация в промпта: „Генерирай 22-годишна жена пациент с НРЛ“ вместо отворено „генерирай пациент с НРЛ“.
- Използвайте seeds / множество извиквания: генерирайте 5-10 кандидата и семплирайте произволно, вместо да вземете първия.
- Комбинирайте отговори от различни модели: обобщение от Gemini + Grok + DeepSeek дава много по-широко разпределение от единичен модел.
- Одитирайте изхода: веднъж на тримесечие — генерирайте N=100 отговора и проверете разпределението на пол, възраст, фамилии. Моделите се променят с всяко ново издание.
Изходни данни и репликация
Всичките 240 сурови отговора са на разположение при запитване. Скриптовете за репликация — също.
| Елемент | Стойност |
|---|---|
| Общ брой заявки | 240 (6 модела × 4 разстройства × 10 повторения) |
| Температура | 0.9 |
| Максимум токени | 60 (200 за GPT-5.5, 2000 за Gemini 3.1) |
| Начин на извикване | HTTPS POST към OpenRouter API, паралелно (asyncio + httpx) |
| Едновременност | 20 (семафор) |
| Общо време | ~3 мин за 240 извиквания |
| Език | Полски (промпт и очакван изход) |
| Класификация по пол | Евристика: собствено име, завършващо на „a“ → жена, в противен случай → мъж (типично за полски) |
Ограничения на изследването
- Малка извадка на клетка: 10 повторения са твърде малко за строга статистическа значимост. Резултатите описват тенденция, а не доказателство.
- Евристика за пол: класификацията по окончание на името е несъвършена (напр. „Kuba“, „Bonifacy“). На практика работи с >95% точност за полски имена.
- Само 4 разстройства: за по-пълна картина е необходимо разширяване до гранично разстройство на личността, ХАДВ, шизофрения, ПТСР, аутизъм.
- Само полски контекст: пристрастието може да изглежда много по-различно за английски, немски или испански пациенти.
- Моментна снимка във времето: резултатите са валидни за версиите на моделите от април 2026. След актуализации на моделите тенденциите на пристрастие могат да се изместят.
Изтеглете суровите данни (19 KB)
Оставете имейл — ще ви изпратим ZIP: всичките 240 отговора на LLM (results.json), обобщени отчети (final_report.md, per_model_report.md) и Python скриптовете за възпроизвеждане на експеримента.
CC-BY 4.0 · Без paywall · Без продажбено проследяване.