Pseudonymizace dat: dvě vrstvy ochrany soukromí pacienta
Váš terapeut o vás ví věci, které nikde jinde nepíšete.
Když platforma AI analyzuje tyto rozhovory - co přesně se odesílá modelu?
V TherapySupport jsme si tuto otázku položili přímo. Bez dodatečných opatření by jména pacientů, telefonní čísla, rodná čísla a adresy proudily do Azure OpenAI - vše v jediném požadavku modelu.
Postavili jsme proto dvouvrstvý systém ochrany dat, v souladu s požadavky GDPR a normami HIPAA a SOC 2.
Vrstva první - šifrování na úrovni databáze
Citlivá data pacientů jsou uložena pomocí Always Encrypted v SQL Serveru. To znamená, že správce databázového serveru nemá přístup k obsahu šifrovaných sloupců s citlivými daty v čitelné podobě. Šifrovací klíče se nacházejí výhradně v Azure Key Vault a nikdy neopouštějí důvěryhodné prostředí.
Vrstva druhá - pseudonymizace před odesláním AI
Než je přepis sezení odeslán modelu AI, projde třemi vrstvami ověření. Systém identifikuje data z profilu pacienta, rozpoznává třetí osoby zmíněné během rozhovoru - partnery, kolegy - a detekuje telefonní čísla a adresy.
Každá identifikovaná osoba dostane pseudonym. Jan Novák se stává [PACIENT]. Anna, kolegyně z práce - [OSOBA_1]. Model dostane souvislou historii sezení, ale bez jakéhokoli skutečného jména, čísla nebo adresy.
Model AI dostane úplný klinický kontext. Terapeut dostane spolehlivou analýzu. Data pacienta zůstávají v našem systému.

Proč dvě vrstvy, ne jedna
Šifrování chrání data v klidu - v databázi. Pseudonymizace chrání data v pohybu - v promptu, v logách, ve vektorových vloženích odesílaných modelu. Jde o dva nezávislé mechanismy řešící dva odlišné problémy. Žádný z nich nenahrazuje ten druhý.
V oblasti duševního zdraví znamená narušení soukromí konkrétní újmu způsobenou konkrétnímu člověku - ve chvíli, kdy je nejzranitelnější. Proto záleží na každé vrstvě ochrany.
#GDPR #HIPAA #SOC2 #AI #HealthTech #Soukromí #Pseudonymizace #Microsoft #AlwaysEncrypted #SQLServer #TherapySupport