Ali smete model trenirati na podatkih strank? GDPR in mnenje EDPB 28/2024 v praksi
Kaj mnenje EDPB 28/2024 pomeni za učenje modela na podatkih strank: pravna podlaga, anonimizacija pred učenjem, test pomnjenja, ocena učinka (DPIA) in kontrolni seznam.
Ekipa za podporo, zavarovalnica ali odvetniška pisarna želi model, ki pozna njihove primere. Ti primeri so polni imen, naslovov, številk pogodb in včasih zdravstvenih podatkov. Vprašanje, ki ga pooblaščenec za varstvo podatkov postavi, preden kdorkoli kaj podpiše: ali smemo model sploh učiti na tem?
Kratek odgovor: da, če imate pravno podlago, uporabite samo podatke, ki jih naloga potrebuje, in osebne podatke pred začetkom učenja odstranite ali psevdonimizirate. Model, učen na surovih zapisih strank, ni anonimen samo zato, ker je "le uteži". Evropski odbor za varstvo podatkov je to zapisal decembra 2024, vi pa morate znati pokazati, kaj ste glede tega naredili.
To ni pravni nasvet. Odloči vaš pooblaščenec; ta zapis mu da nekaj konkretnega, o čemer lahko odloči.
Kaj mnenje EDPB 28/2024 v resnici pravi
Mnenje 28/2024 o vidikih varstva podatkov pri modelih UI (PDF) je bilo sprejeto na zahtevo irskega nadzornega organa. Za fino uglaševanje so pomembne tri točke.
Preizkus anonimnosti. Modelov UI, učenih na osebnih podatkih, ni mogoče v vseh primerih šteti za anonimne. Model je anonimen le, če sta zanemarljivo verjetni dve stvari: neposredno izločanje osebnih podatkov ljudi iz učnega nabora iz modela in pridobivanje takih podatkov s poizvedbami, namerno ali ne. Obe se presojata glede na "vsa sredstva, za katera je razumno verjetno, da bodo uporabljena", ne samo vaša, tudi tuja.
Od primera do primera. Nadzorni organi presojajo vsak model posebej, na podlagi vaše dokumentacije. Mnenje našteje, kaj lahko pogledajo: kako so bili izbrani viri, ali ste razmislili o anonimiziranih ali psevdonimiziranih podatkih, najmanjši obseg podatkov in filtriranje pred učenjem, izbire pri učenju, ki zmanjšajo prepoznavnost, in teste proti napadom, kot so sklepanje o članstvu, dobesedno vračanje učnih podatkov, inverzija modela in rekonstrukcija. Če ne morete dokumentirati, da je model anonimen, lahko organ to obravnava kot kršitev načela odgovornosti iz člena 5(2).
Zakoniti interes je mogoč. GDPR nima hierarhije pravnih podlag. Če se opirate na člen 6(1)(f), potrebujete tri korake: zakonit, jasno opredeljen in sedanji interes; nujnost, vključno z vprašanjem, ali bi zadoščalo manj podatkov; in tehtanje, pri katerem štejejo razumna pričakovanja ljudi. Stranka, ki je pisala vaši podpori, ne pričakuje samodejno, da bo njeno sporočilo postalo učni podatek.
Mnenje obravnava tudi, kaj velja, če je bil model razvit nezakonito. Na kratko: če osebni podatki ostanejo v modelu, gre težava z njim naprej.
Zakaj samo fino uglaševanje modela ne naredi anonimnega
Jezikovni modeli si zapomnijo. Ne vsega in ne enakomerno, a redek niz, ki se v učnih podatkih ponovi večkrat, na primer EMŠO stranke v podpisu ali IBAN v vsakem odgovoru na račun, se lahko vrne dobesedno, ko model dobi pravi začetek.
Majhni nabori za fino uglaševanje to poslabšajo, ne izboljšajo. Vsak zapis model vidi večkrat, zato ima ime, ki v desetih zahtevkih stoji ob diagnozi ali dolgu, kar dobro možnost, da se ponovi.
Model, ki teče samo znotraj podjetja, tveganje zmanjša, in mnenje izrecno pravi, da se notranji model lahko presoja drugače kot javni. Tveganja ne odpravi. Zaposleni ga lahko sprašujejo, uteži pa je mogoče kopirati.
Kako to naredimo v projektu
1. Najprej vzorec. Pred kakršnimkoli učenjem popišemo, kateri osebni podatki so v vzorcu vaših dokumentov in kje: glave, podpisi, prosto besedilo, priloge.
2. Odstranitev ali zamenjava pred učenjem. Strukturirane slovenske oznake ujamejo pravila: EMŠO s kontrolno števko, davčne številke, IBAN, telefonske številke, e-poštni naslovi. Imena in naslovi v vseh sklonih potrebujejo model, naučen za to nalogo. Kako to merimo po vrstah podatkov, smo opisali v zapisu o anonimizaciji slovenskih dokumentov z lokalnim modelom. Kjer mora naloga vedeti, da sta dve sporočili od iste osebe, psevdonimiziramo dosledno, tabelo ključev pa hranimo ločeno od učnih podatkov.
3. Test pomnjenja na zamrznjenem naboru. Po učenju poženemo stalen nabor preizkusov: začetke učnih zapisov, da vidimo, ali model dopolni oznake, neposredna vprašanja o osebah iz podatkov in podtaknjene testne zapise z izmišljenimi oznakami, ki se ne smejo nikoli vrniti. Poročilo navede vsak zadetek dobesedno. Isti nabor teče na vsaki novi različici, zato ponovno učenje stanja ne more tiho poslabšati.
4. Zapis za oceno učinka. Viri, kaj je bilo odstranjeno in kako, rezultati preizkusov, kje model teče in kdo ga lahko sprašuje. To je dokumentacija, ki jo po mnenju organi lahko zahtevajo.
Nekatero znanje je bolje sploh ne dati v uteži. Cene, pogodbeni pogoji in vse, za kar lahko kdo zahteva izbris, sodijo v bazo znanja, ki jo model prebere ob vsakem odgovoru. Dokument tam izbrišete v sekundi. Osebo iz uteži izbrišete s ponovnim učenjem. Več o tej izbiri v zapisu fino uglaševanje ali RAG.
Lastni strežnik ali API ponudnika: kdo je obdelovalec?
| API ponudnika za fino uglaševanje | Učenje pri nas, model na vašem strežniku | |
|---|---|---|
| Kdo hrani učne podatke | ponudnik, pogosto zunaj EU | mi v EU po pogodbi o obdelavi ali samo vaša strojna oprema |
| Obdelovalec po členu 28 | ponudnik in njegovi podobdelovalci | mi, med učenjem; ko model teče na vašem strežniku, nihče zunanji |
| Prenos v tretje države (poglavje V) | pogosto, zato potrebujete sklep o ustreznosti ali druge zaščitne ukrepe | ga ni |
| Kdo lahko sprašuje model | infrastruktura ponudnika, pri vsakem klicu | kogar spustite v svoje omrežje |
| Izbris ob koncu | po pogojih ponudnika | zapisan v pogodbi o obdelavi; uteži ostanejo vam |
Pri gostovanem API-ju gre poziv ven pri vsakem klicu, zato vprašanje prenosa ni enkratno. Na strani varnost in skladnost je našteto, kaj podpišemo, preden vidimo prvi dokument.
Kontrolni seznam za pooblaščenca (10 točk)
- Kakšen je namen modela, v enem stavku, in katera pravna podlaga pokriva učenje zanj?
- Če je podlaga zakoniti interes: ali je presoja v treh korakih zapisana, vključno z razumnimi pričakovanji ljudi?
- Katere vrste podatkov so v izvornih dokumentih? So med njimi posebne vrste iz člena 9?
- Katera polja naloga res potrebuje in kaj je bilo pred učenjem odstranjeno?
- Anonimizirano ali psevdonimizirano? Če psevdonimizirano: kje je tabela ključev in kdo jo lahko odpre?
- Je bil korak odstranjevanja izmerjen po vrstah podatkov, s priklicem v poročilu?
- Je bil naučeni model preizkušen na pomnjenje in so zadetki našteti?
- Kdo je obdelovalec v vsaki fazi in ali obstaja pogodba o obdelavi?
- Ali kakšni podatki ali pozivi zapustijo EU, med učenjem ali med uporabo?
- Kako boste obravnavali zahtevo za izbris: baza znanja, ponovno učenje ali oboje?
Kdaj vsega tega ne potrebujete
- Naloga deluje na dokumentih brez osebnih podatkov, na primer navodilih za izdelke ali notranjih postopkih. Učite na njih.
- Odgovori so odvisni od dejstev, ki se spreminjajo ali morajo biti izbrisljiva. Uporabite iskanje po bazi znanja in učenje izpustite.
- Na mesec imate peščico dokumentov. Človek je cenejši od ocene učinka.
Kako začnemo
Aktualne cene so v našem ceniku.
| Korak | Kaj dobite |
|---|---|
| Enodnevna evalvacija | modeli, izmerjeni na petdesetih vaših anonimiziranih primerih, in pisni seznam vrst osebnih podatkov, ki jih je treba pred učenjem odstraniti |
| Pilot S | učenje na podatkih, ki jih že imate, s preizkusi pomnjenja v zamrznjenem naboru, 2–3 tedne; anonimizacija surovih dokumentov sodi v Pilot M |
| Pilot M | ko je treba najprej zgraditi oznake ali model za anonimizacijo, 4–5 tednov |
| Mesečna naročnina | ponovno učenje in ponovna ocena na zamrznjenem naboru (s preizkusi pomnjenja) |
Pogosta vprašanja
Ali je model, fino uglašen na osebnih podatkih, samodejno anonimen? Ne. Mnenje EDPB 28/2024 pravi, da modelov, učenih na osebnih podatkih, ni mogoče v vseh primerih šteti za anonimne. Izločanje osebnih podatkov iz modela in njihovo pridobivanje s poizvedbami morata biti zanemarljivo verjetna, to pa morate znati dokazati.
Katero pravno podlago potrebujemo za učenje na podatkih strank? GDPR nima hierarhije pravnih podlag, zato je odvisno od primera. Zakoniti interes je mogoč, če prestanete preizkus v treh korakih: resničen in jasno opredeljen interes, nujnost in tehtanje, pri katerem štejejo razumna pričakovanja ljudi.
Ali anonimizacija podatkov pred učenjem reši težavo? Večino. Če v učenje ne gredo osebni podatki, iz modela malo pride ven. Že sama anonimizacija pa je obdelava osebnih podatkov in sodi v evidenco dejavnosti obdelave ter, kjer je tveganje veliko, v oceno učinka.
Kaj, če stranka zahteva izbris svojih podatkov? Zapis iz baze izbrišete hitro. Odstraniti ga iz uteži modela navadno pomeni ponovno učenje. To je najmočnejši praktični razlog, da osebne podatke odstranite pred učenjem ali jih hranite v bazi znanja, po kateri model išče.
Koliko stane, da izvemo, katere osebne podatke vsebujejo naši dokumenti? Začne se z enodnevno evalvacijo na petdesetih vaših primerih, ki jo upoštevamo pri pilotu. Aktualne cene so v ceniku.