Pseudonymizace
Nahrazení reálného identifikátoru umělým klíčem. Umožňuje zpětnou identifikaci pouze s přístupem k převodní tabulce.
Zjistit vícePraktický průvodce metodami, jak zbavit textové vstupy citlivých údajů předtím, než opustí vaši bezpečnou infrastrukturu směrem k velkým jazykovým modelům.
Když jsem v roce 2019 pracoval na jednom projektu pro středně velkou banku, narazili jsme na problém, který dnes řeší skoro každý. Potřebovali jsme analyzovat tisíce zákaznických stížností pomocí externího enginu. Jenže v těch textech bylo úplně všechno: jména, čísla účtů, a dokonce i poznámky o zdravotním stavu, které tam klienti psali v afektu. Tehdy jsem si uvědomil, že poslat taková data "ven" bez úpravy je jako nechat otevřený trezor na ulici.
Anonymizace není jen o smazání jména. Je to komplexní inženýrský proces, který musí zajistit, aby z textu zmizely PII (Personally Identifiable Information), ale zároveň aby věta neztratila svůj logický význam pro AI model. Pokud nahradíte všechna podstatná jména hvězdičkami, dostanete nepoužitelný shluk znaků. Moderní techniky, jako je šifrování a bezpečný přenos dat, musí jít ruku v ruce s inteligentním maskováním.
Dnes se bavíme o třech hlavních pilířích: detekci, klasifikaci a transformaci. Detekce využívá regulární výrazy pro pevné formáty (jako rodná čísla) a modely Named Entity Recognition (NER) pro volný text. Klasifikace určí, zda jde o jméno, lokalitu nebo datum. A transformace? Ta rozhodne, zda údaj smažeme, nahradíme pseudonymem nebo zobecníme.
Nahrazení reálného identifikátoru umělým klíčem. Umožňuje zpětnou identifikaci pouze s přístupem k převodní tabulce.
Zjistit vícePřidání matematického šumu do dat, aby nebylo možné určit přítomnost konkrétního jednotlivce v datasetu.
Právní aspektyMetoda úpravy dat tak, aby každý záznam byl nerozeznatelný od alespoň k-1 dalších záznamů v dané skupině.
Kontrolní seznam"Pamatuji si, jak se mě jeden klient ptal: 'Proč prostě nepoužijeme Najít a nahradit?' Odpověděl jsem mu, že pokud nahradí 'Jan Novák' za 'Osoba X', ale nechá tam větu 'ředitel pobočky v Horní Dolní s 25 lety praxe', tak anonymizace fakticky neproběhla. Kontext je silnější než jméno."
— Hlavní inženýr Mamboco
| Typ dat | Riziko úniku | Doporučená technika |
|---|---|---|
| Osobní jména | 100% identifikace | NER + Pseudonymizace |
| Lékařské diagnózy | Vysoké (Citlivá data) | Generalizace (např. 'Onkologie') |
| IP adresy | Střední | Maskování (192.168.x.x) |
Bohužel ne. Existuje tzv. "re-identifikace útokem na propojení". Pokud útočník zná jiné veřejné databáze, může kombinací věku, PSČ a pohlaví identifikovat až 87 % populace USA. U textu AI je nutné hlídat i unikátní styl psaní nebo specifické události popsané v textu.
Pseudonymizace je vratný proces (máte klíč), zatímco anonymizace by měla být nevratná. Z pohledu GDPR je pseudonymizovaný údaj stále považován za osobní údaj, zatímco skutečně anonymizovaný údaj již nikoliv.
Při nesprávném nastavení ano. Pokud ale použijete techniku nahrazení entit (např. nahradíte konkrétní město štítkem [LOCATION]), model stále chápe syntaktickou strukturu věty a logiku požadavku, což pro většinu úloh stačí.
Správná konfigurace soukromí a anonymizačních filtrů je prvním krokem k bezpečnému nasazení AI ve vaší firmě. Nečekejte na první incident.
Tento web slouží jako nezávislý informační a referenční zdroj. Projekt není spojen s žádnými vládními úřady, veřejnými institucemi, komerčními dodavateli technologií ani držiteli ochranných známek třetích stran. Veškeré informace jsou poskytovány pro vzdělávací účely v oblasti bezpečnosti dat a umělé inteligence.