Pred odoslaním klientskych spisov do cloudovej umelej inteligencie čelí advokát zásadnej otázke: ako ochrániť dôverné údaje a neporušiť mlčanlivosť. Riešením môže byť lokálna umelá inteligencia (lokálna AI), ktorá beží výlučne na zariadeniach vo vašej kancelárii. Nasadenie takéhoto riešenia je však viac než len inštalácia jedného programu.
“Lokálna AI je výborným nástrojom na ochranu údajov pred cloudom, ale vyžaduje špecifický hardvér, sofistikované procesy a neustálu ľudskú kontrolu.”
Kľúčové body, ktoré v článku rozoberieme:
- Hardvér a inteligencia – prečo bežný notebook nestačí a aký je rozdiel medzi lokálnym modelom a cloudom.
- Softvérová realita – bežný užívateľ a často ani IT admin na túto úlohu spravidla nestačí.
- Skryté riziká a limity – úskalia metadát, dôverné dáta, strata právneho kontextu a nutnosť predbežnej mechanickej úpravy.
Hardvér a inteligencia: Koľko výkonu skutočne potrebujeme?
Spustenie zmysluplného generatívneho jazykového modelu (LLM) priamo v kancelárii je finančne aj technicky náročné. Nejde o bežnú kancelársku aplikáciu.
Rozhodujúcim parametrom pre beh umelej inteligencie je veľkosť pamäte grafickej karty (VRAM). Napríklad model so 14 miliardami parametrov vyžaduje v 16-bitovej presnosti približne 28 GB pamäte VRAM len na uloženie samotných váh modelu. Ďalšie GB na samotnú prácu.
Na ilustráciu, špičková spotrebiteľská grafická karta ako RTX 5090 disponuje 32 GB VRAM, pričom jej cena sa bežne pohybuje na úrovni 2 500 až 3 000 €.
Na trhu existujú aj špeciálne počítače optimalizované pre umelú inteligenciu. Ide napríklad o zariadenia Apple s čipmi rodiny M (Apple Silicon, ktoré umožňujú využiť veľkú zdieľanú pamäť na lokálne aplikácie), prípadne špecializované pracovné stanice od Nvidie či Asusu. Pri takomto hardvéri však treba počítať s investíciou v rádoch 2 000 až 10 000 € a viac.
Prečo to nespustiť na bežnom notebooku?
Teoreticky dokážete menšie modely spustiť aj na bežnom, výkonnejšom kancelárskom notebooku. Existujú možnosti ako spúšťať modeli nie na VRAM ale na výpočtovej kapacite procesora (CPU), avšak rozdiel je citeľný aj pri výkonných procesoroch.
Z hľadiska používateľskej skúsenosti je to frustrujúce. Kým v cloude získate odpoveď takmer okamžite, na slabom lokálnom hardvéri budete doslova čakať na generovanie slova po slove. Pre reálnu a plynulú prácu advokáta je takýto postup neefektívny / nereálny.
Lokálna AI verzus Cloudová AI (Rozdiel v inteligencii)
Okrem rýchlosti je tu zásadný rozdiel v “inteligencii” modelov. Na lokálnom počítači zvyčajne spustíte modely, ktoré majú okolo 7 až 70 miliárd parametrov. Modely, na ktoré ste zvyknutí z cloudu (napríklad GPT, Claude alebo Gemini), však disponujú stovkami miliárd až biliónmi parametrov.
Znamená to, že lokálny model nikdy nebude taký schopný, bystrý, kontextovo presný, či kreatívny ako cloudové modely. Dokáže plniť úzke, špecifické úlohy (ako je vyhľadanie mien), ale na komplexnú právnu analýzu nemá dostatočnú kapacitu.
Softvér a nastavenie: Zvládne to bežný užívateľ?
AI Modely
Samotný model je len súbor parametrov a postup výpočtu. Aby z neho bol použiteľný nástroj pre advokáta, musíte k nemu pridať aplikáciu, ktorá rieši načítanie dokumentov, ovládanie a bezpečné ukladanie.
Užívateľ, admin, programátor?
Tu narážame na personálny problém. Bežný používateľ a často ani IT správca, ktorý sa vo vašej kancelárii stará o siete, tlačiarne a Microsoft 365, vám s tým s najväčšou pravdepodobnosťou nebude vedieť pomôcť. Vybudovanie lokálneho anonymizéra vyžaduje programátora, ktorý takúto aplikáciu s napojením na modely vytvorí. Je to komplexný vývojový projekt.
Samozrejme vám s tým vie pomôcť AI, ale bez akýchkoľvek programátorských zručností to pre vás bude veľmi dlhý proces vyžadujúci učenie sa množstva nových vecí z oblasti programovania a AI. Čo nie každý chce absolvovať.
Hotové riešenia
Ak si nechcete aplikáciu nechať nakódovať na mieru, alternatívou je využiť existujúce hotové (platené alebo free/trial) produkty.
Možnosti a požiadavky – Na trhu už figurujú desktopové či serverové riešenia, ako napríklad anonym.plus, anonym.legal Desktop, CaseGuard Studio, ADMIS Anonymizér či Limina. Každý z týchto nástrojov funguje na iných princípoch, inom licenčnom systéme a je potrebné pri nich overiť, aké presné funkcie vykonávajú plne offline, či a čo posúvajú na ich servery a pod.
Aj pri týchto produktoch často musíte urobiť pomerne technicky zložité nastavenia, doplnenia a pod. (napr. špecifické typy údajov na anonymizáciu a ako s nimi má systém pracovať).
Slovenčina – Jazykové špecifiká slovenčiny (skoňovanie) vedia pri menách a adresách narobiť deterministickým systémom veľké problémy. Preto sa používajú (nižšie spomínané NER modely). Avšak pre slovenčinu ani tu neexistuje príliš veľa možností. A nie všetky hotové riešenia vedia pracovať aj so slovenčinou.
Skenované dokumenty vs. Text – ďalšou pascou sú skenované dokumenty, pdf a pod. Tam je potrebné správne použiť OCR systémy na detekciu obsahu, čo samo o sebe predstavuje priestor pre ďalšiu chybovosť.
Prečo AI nedokáže anonymizovať celý dokument naraz
Jedným z najväčších omylov je predstava, že vezmete rozsiahly spis, nahráte ho do AI a prikážete: “Anonymizuj to.” Generatívnemu modelu by sa nemal odovzdávať celý dokument na voľný prepis, pretože hrozí neúmyselná zmena právneho významu textu. Jednoducho vynechá a zabudne.
Lokálna AI má ešte viac obmedzenú pamäť ako cloudová. Všeobecne platí, že dobre si zapamätá úvod a záver dokumentu, ale dôležitý stred textu môže úplne “zabudnúť” alebo prehliadnuť. Halucinácie pri lokálnej AI preto môžu byť oveľa výraznejšie.
Preto musí aplikácia dlhý dokument technicky rozsekať na menšie bloky (tzv. chunking) a dbať na to, aby sa napríklad rovnaké osoby v prekrývajúcich sa blokoch identifikovali konzistentne. Aby sa napr. z dvoch zmluvných strán z úvodu zmluvy postupne v dokumente nestalo 4-5 rôznych strán identifikovaných ako OSOBA_1, OSOBA_2 … OSOBA_5.
Keby sme sa pokúsili dať celý dokument lokálnej AI na anonymizáciu, mohlo by sa stať, že okrem nekonzistentnej anonymizácie osôb, miest a pod., by mohla aj vypustiť celé časti textu.
AI technicky funguje na generovaní najbližšieho slova za existujúcim textom (počíta pravdepodobnosti) a pri všetkých obmedzeniach, ktoré lokálna AI má, sa veľmi ľahko môže stať, že niečo preskočí, preformuluje, skráti a pod. Dostať anonymizovaný text obsahovo 1:1 s pôvodným textom z lokálnej AI si vyžaduje veľké programátorské úsilie a itak nebudeme mať 100% istotu, že pri každom dokumente to tak urobí.
Viackrokový proces: Najprv mechanika, potom AI
Z tohto dôvodu prebieha bezpečná lokálna anonymizácia vo viacerých krokoch. Ešte pred zapojením AI modelu musí nastúpiť takzvaná deterministická úprava:
- Pravidlá a validátory: Regulárne výrazy slúžia na zachytenie formátov, ako sú rodné čísla, IBAN či telefónne čísla, e-maily.
- NER modely: Malé, úzko špecializované modely slúžiace výlučne na detekciu pomenovaných entít (mien, organizácií, miest, ulíc a pod.).
Ako bolo vyššie spomenuté, buď si takúto aplikáciu necháte naprogramovať, alebo využijete existujúce riešenia.
Až po tomto základnom prečistení nastupuje kontextová generatívna AI, ktorá dokáže identifikovať zvyškové a nejasné údaje. Vie pracovať s kontextom a “pochopiť” aj veci, ktoré deterministické systémy nezvládnu.
V bežnom jazyku existuje veľa možností, ako môžu byť určité veci vyjadrené a napísané, rôzne hraničné situácie či preklepy. Deterministicky všetky tieto nuansy odchytiť je nemožné. V tom však vie pomôcť lokálny AI model.
Ľudská kontrola a strata právneho kontextu
Základné pravidlo znie: žiadny softvér nespraví anonymizáciu na 100 percent. Aj kvalitne nastavené deterministické systémy (pravidlá a NER modely) sa úspešnosťou pohybujú spravidla okolo 90 až 96 %. Vždy tam preto musí byť odborná ľudská kontrola advokátom. Kontrolovať sa nesmú len nájdené entity, ale najmä to, čo systém vôbec nenašiel. A ak sa aj pri ladení systému dostanete na 97-98%, stále treba tie 2% dohľadať.
Vzniká tu však aj opačný problém: nadmerná redakcia. Ak z dokumentu odstránite úplne všetky identifikačné znaky, dátumy, či nezvyčajné sumy, odstránite tým aj samotné fakty prípadu. Takýto dokument stratí svoj právny rámec a kontext a pre AI analýzu v cloude už nebude dávať úplne zmysel. Pri niektorých vysoko špecifických prípadoch preto bezpečné prenesenie do cloudovej AI jednoducho nie je možné a celá analýza musí zostať lokálne.
Oplatí sa niektoré dokumenty anonymizovať?
Okrem toho sa dostávame aj do roviny… Koľko vlastnej práce musíme vykonať pri úprave a kontrole dokumentov a kedy sa nám ešte ich anonymizácia vypláca a kedy je to viac práce, ako keby sme si ich analýzu urobili sami. Toto si samozrejme musíme rozhodnúť každý sám prípad od prípadu.
Pozor na “neviditeľnú” zradu: Metadáta vo Worde (DOCX)
Ak poviete lokálnej AI, aby vám anonymizovala Wordový dokument a vygenerovala ho naspäť ako Word, vystavujete sa veľkému riziku. DOCX dokument nie je len čistý text. Obsahuje hlavičky, päty, komentáre, poznámky, sledované zmeny a metadáta o autoroch.
Hoci môže byť viditeľný text v dokumente dokonale zmenený, pôvodné osobné údaje a citlivé informácie môžu ostať zachované v neviditeľnej technickej vrstve súboru. Preto by mala lokálna anonymizácia vždy pracovať s extrahovaným čistým textom a exportovať pracovnú verziu (napríklad vo formáte Markdown), aby nedošlo k pribaleniu skrytých digitálnych stôp pôvodného originálu.
Zhrnutie
Lokálna AI môže byť cennou ochrannou vrstvou pri spracovaní klientskych dát. No nejde o jednoduchú záležitosť. Má viaceré obmedzenia, úskalia a vyžaduje si pomerne vysoké investície.
- Náklady na hardware a zručnosti: Potrebujete drahý hardvér (od 3 000 € vyššie) a často skutočného programátora, nie bežného užívateľa či IT administrátora.
- Obmedzenia modelov: Lokálne AI modely sú pomalšie a menej inteligentné ako cloudové. Dokumenty sa musia predpripraviť a spracovávať vo viacerých krokoch.
- Nutnosť kontroly: Bez finálnej vizuálnej kontroly advokátom sa nezaobídete, inak riskujete únik dát, či stratu podstatného právneho významu.
➡️ Na prvý pohľad lokálna anonymizácia s AI znie výborne. Beží to u nás a je to zadarmo… Realita je trochu iná. Vie nám výborne pomôcť, ale vyžaduje investície, dobre navrhnutý systém a disciplínu pri práci. Nevyrieši to stiahnutie si zadarmo nejakého lokálneho AI modelu.
Neviete, aký je pre vašu kanceláriu najbezpečnejší postup pri zavádzaní AI? Sledujte tento blog a môj LinkedIn, prípadne si dohodnite konzultáciu.