← Blog
Dokumenti

Anonimizacija slovenskih dokumentov z lokalnim modelom: natančnost, GDPR in cena

Zakaj regex pri slovenskih sklonih in EMŠO odpove, kako merimo priklic lokalnega modela 4B–12B s pravili, kaj GDPR šteje za anonimno in koliko stane.

Tadej Fius · MediaAtlas 8 min branja

Sodišče, notariat ali podjetje, ki hrani dokumente za druge, nas vpraša isto: ali lahko model naše slovenske dokumente anonimizira dovolj dobro, da jih objavimo, delimo ali pošljemo naprej, in ali to zmore, ne da bi dokumenti zapustili naš strežnik?

Kratek odgovor: da, če pravila združite z majhnim lokalnim modelom in rezultat izmerite na svojih dokumentih. Pravila ujamejo strukturirane oznake. Model velikosti 4B do 12B, naučen na vaših primerih, ujame imena, naslove in kontekst, ki jih pravila zgrešijo. Ali se lahko nanj zanesete, odloči priklic po vrstah podatkov, izmerjen na zamrznjenem naboru. Ne predstavitev in ne obljuba ponudnika.

Anonimizacija ali psevdonimizacija: kaj GDPR šteje za kaj

Besedi se uporabljata kot sopomenki. Pravno nista.

Psevdonimizacija zamenja oznake z nadomestki (OSEBA_1, NASLOV_2) in ohrani tabelo, s katero jih lahko vrnemo nazaj. Opredeljuje jo člen 4(5) GDPR, podatki pa za tistega, ki ima tabelo, ostanejo osebni. Koristna je, ko mora dokument nekam in nazaj, na primer v zunanji model, imena pa je treba potem obnoviti.

Anonimizacija povezavo odstrani za vedno. Tabele ni in nihče ne more osebe razumno ponovno prepoznati, tudi z drugimi podatki, ki jih ima. Po uvodni izjavi 26 anonimni podatki niso predmet GDPR. Prag je visok: redek poklic, majhna vas in datum nesreče skupaj lahko razkrijejo človeka, tudi če imena ni več.

Ena podrobnost iz leta 2025. V zadevi EDPS proti SRB (C-413/23 P) je Sodišče EU presodilo, da psevdonimizirani podatki za prejemnika, ki nima razumnih sredstev za ponovno prepoznavo, morda niso osebni podatki, za pošiljatelja pa ostanejo osebni. Obveznosti pošiljatelja, na primer obveščanje posameznikov, ostanejo. Smernice EDPB o psevdonimizaciji (01/2025) opisujejo, kako jo izvesti pravilno. To ni pravni nasvet; katero od obojega potrebujete, odloči vaš pooblaščenec za varstvo podatkov.

Zakaj pravila in regex pri slovenščini odpovejo

Pravila delujejo dobro, kjer je oblika stalna. EMŠO ima 13 števk in kontrolno števko, zato ga pravilo najde in preveri. Enako velja za davčne številke, IBAN, e-poštne naslove in telefonske številke. Za te vedno uporabimo pravila, ker so poceni in predvidljiva.

Pravila nehajo delovati tam, kjer se začne slovnica:

  • Imena se sklanjajo. "Denis Kotnik" se kasneje pojavi kot "Denisa Kotnika", "Kotniku" ali samo "Kotnik". Seznam imen iz glave ujame prvo obliko in zgreši ostale.
  • Odloča kontekst. V sodni odločbi ime sodnika navadno ostane, ime stranke pa gre ven. Odvetnik, izvedenec ali sosed, ki je videl nesrečo, so tudi ljudje. Pravilo ne loči vloge od imena.
  • Ni vsak naslov bivališče. "Gosposka ulica" je lahko kraj dejanja, sedež podjetja ali kraj, kjer obdolženi živi. Samo zadnje ga razkrije.
  • Ni vsak datum datum rojstva. Odločba ima datum nesreče, obravnave in sodbe. Oseben je samo eden, če sploh.
  • Ena oseba, ena oznaka. Če "Kotnik" v enem odstavku postane OSEBA_1, v drugem pa OSEBA_3, besedilo izgubi smisel, psevdonimiziranega dokumenta pa ni več mogoče obnoviti.

Seznam vseh slovenskih imen in priimkov tega ne reši. Veliko priimkov je hkrati navadnih besed ali krajevnih imen, zato seznam odstrani preveč in dokument postane neberljiv.

Lokalni mali model in pravila: cevovod

Kar za tako nalogo zgradimo:

  1. Zajem besedila. OCR in postavitev strani za skenirane dokumente, da se glave, tabele in noge ne izgubijo.
  2. Pravila za strukturirane oznake. EMŠO s kontrolno števko, davčna številka, IBAN, e-pošta, telefon, registrske tablice.
  3. Majhen model za vse, kar je odvisno od konteksta. Model 4B do 12B, naučen na vaših označenih primerih, označi osebe, naslove, datume rojstva in druge vrste, ki jih določite vi, v vseh sklonih, in jih vrne kot JSON po stalni shemi.
  4. Zamenja koda, ne model. Model najde entitete, deterministični korak jih zamenja, sklonske oblike iste osebe združi pod eno oznako in zapiše tabelo ključev, če potrebujete psevdonimizacijo.
  5. Merjenje na zamrznjenem naboru. Isti dokumenti, isti zlati odgovori, vsaka različica.

Merimo tri stvari, po vrstah podatkov:

  • Priklic: koliko vseh osebnih podatkov v dokumentu je odstranjenih. Vsak zgrešen je uhajanje, zato je ta na prvem mestu.
  • Natančnost: koliko odstranjenega je bilo res osebnega. Nizka natančnost pomeni neberljiv dokument.
  • Doslednost: ali ista oseba vedno dobi isto oznako in ali obnova iz tabele vrne izvirnik.

Eno povprečje čez vse vrste skrije težavo. Visok skupni rezultat lahko prekrije eno vrsto, recimo datume rojstva, ki znova in znova uide. Poročilo pokaže vsako vrsto posebej, z zgrešenimi primeri, navedenimi dobesedno.

Kako izgledajo številke pred in po učenju

Javne številke za anonimizacijo tu nimamo in si je ne bomo izmislili. Nabori, ki jih zgradimo za naročnika, nastanejo iz njegovih dokumentov in ostanejo pri njem.

Javno lahko pokažemo isti postopek pri drugih nalogah. Pri modelu za razpoznavanje slovenskega govora je fino uglaševanje znižalo delež napačnih besed s 46,8 % na 22,3 %. Sraka 27B doseže na Slovenian-LLM-Eval 0,871 proti 0,844 za svojo osnovo. Obe številki sta izmerjeni na stalnih naborih pred in po učenju. Obliko pokaže naše vzorčno poročilo evalvacije.

Na vaših dokumentih ima tabela eno vrstico za vsako vrsto podatkov (oseba, naslov, datum rojstva, EMŠO, druge oznake) in en stolpec za vsako postavitev: samo pravila, neučen model s pravili in naučen model s pravili. V vsaki celici sta priklic in natančnost na vašem zamrznjenem naboru. Priporočilo pisno pove, ali se naučen model splača in katera vrsta še potrebuje človeški pregled.

Zakaj dokumenti ne smejo zapustiti strežnika in kaj to pomeni za DPIA

Anonimizacija vidi dokumente, preden je karkoli odstranjeno. To je najbolj občutljiv trenutek celotnega postopka. Če to dela tuji API, gre surovo besedilo, z imeni, EMŠO in zdravstvenimi podatki, k obdelovalcu in pogosto v tretjo državo.

Z lokalnim modelom:

  • v evidenci dejavnosti obdelave (člen 30) in oceni učinka (člen 35) ni zunanjega obdelovalca in ni prenosa;
  • "podatki niso odšli" lahko preverite v omrežju, ne le obljubite v pogodbi;
  • še vedno potrebujete pravno podlago, pravilo hrambe za izvirnike in tabelo ključev ter nadzor dostopa do obojega;
  • tudi dnevniki so osebni podatki. Navadno beležimo samo različico modela in zgoščene vrednosti vhoda in izhoda.

Lokalni model ne odpravi potrebe po oceni učinka, kjer je tveganje veliko. Oceno naredi krajšo in lažje zagovorljivo. Če mora psevdonimiziran dokument potem v velik zunanji model, sodi tudi ta korak v oceno. Več o taki postavitvi v zapisu o zasebnem jezikovnem modelu na lastnem strežniku.

Kdaj nas ne potrebujete

  • Nekaj pogodb na mesec, ki jih anonimizira pravnik, ki jih tako ali tako prebere. Nadaljujte ročno.
  • Samo strukturirane oznake (EMŠO, IBAN, davčne številke) v stalnih obrazcih. Pravila zadoščajo in jih napiše vsak razvijalec.
  • Nimate primerov, kako vaši ljudje anonimizirajo danes. Najprej jih zberite petdeset; brez njih ni česa meriti.

Koliko stane

Cene iz našega javnega cenika, v EUR, brez DDV:

Korak Kaj dobite Cena
Enodnevna evalvacija petdeset vaših primerov z zlatimi odgovori, zamrznjen nabor, do pet izmerjenih modelov, priklic in natančnost po vrstah, pisno priporočilo 1.900 €, upoštevano pri pilotu
Pilot S naučen model s pravili na podatkih, ki jih že imate, 2–3 tedne 3.900 €
Pilot M ko je oznake treba najprej zgraditi, 4–5 tednov 12.000 €
Mesečna naročnina nove vrste dokumentov, ponovno učenje, ponovno merjenje na zamrznjenem naboru od 1.200 €

Dobite uteži, pravila, zamrznjen nabor in skripte za evalvacijo. Strojno opremo izberete sami; za model 4B včasih zadošča naprava, ki jo že imate.

Pogosta vprašanja

Ali so psevdonimizirani podatki po GDPR še vedno osebni podatki? Za vas da: kdor ima tabelo ključev, lahko ljudi ponovno prepozna. Za prejemnika brez ključa so lahko zunaj GDPR, odvisno od tega, ali je ponovna prepoznava zanj razumno verjetna.

Ali lahko regularni izrazi anonimizirajo slovenske dokumente? Samo strukturirani del: EMŠO, davčne številke, IBAN, e-pošto in telefonske številke. Imena in naslovi se sklanjajo in so odvisni od konteksta, zato jih pravila sama zgrešijo ali odstranijo preveč.

Katero merilo je pri anonimizaciji najpomembnejše? Priklic po vrstah podatkov, ker je vsak zgrešen podatek uhajanje. Na drugem mestu je natančnost: preveč prekritega besedila naredi dokument neuporaben. Poročamo oboje in doslednost oznak.

Ali lokalni model odpravi potrebo po oceni učinka (DPIA)? Ne. Že sama anonimizacija obdeluje osebne podatke. Lokalni model iz ocene odstrani zunanjega obdelovalca in prenos, zato je ocena krajša.

Koliko stane, da izvemo, ali deluje na naših dokumentih? Enodnevna evalvacija stane 1.900 € in jo upoštevamo pri pilotu. Pilot na podatkih, ki jih že imate, se začne pri 3.900 €.