Varnost pri uporabi AI: katerih podatkov ne smete deliti z umetno inteligenco?
Skrben nadzor nad vnesenimi podatki je temelj varne uporabe potrošniških različic jezikovnih modelov, saj informacije, poslane javno dostopnim orodjem umetne inteligence, zapustijo uporabnikovo lokalno okolje. Vnašanje zaupnih podatkov v orodja AI prinaša tveganje razkritja, kršitve poslovnih skrivnosti in predpisov o varstvu osebnih podatkov. Zato je treba vsako interakcijo z AI obravnavati, kot da bi vsebino javno objavili.
Česa ne smete vnesti v orodja AI?
V javno dostopne modele ne vnašajte naslednjih vrst podatkov:
- osebnih podatkov – imen, priimkov, naslovov, številk EMŠO, telefonskih številk ali e-poštnih naslovov strank, zaposlenih in svojih lastnih;
- zdravstvene dokumentacije – anamnez, izvidov in diagnoz pacientov, za katere veljajo strogi pravni predpisi, kot sta GDPR in HIPAA;
- zaupnih poslovnih informacij – neobjavljenih finančnih poročil, trženjskih strategij, baz strank ter načrtov združitev, prevzemov ali odpuščanj;
- poslovnih skrivnosti – izvorne kode programske opreme, proizvodnih receptur, edinstvenih algoritmov ali interne tehnične dokumentacije podjetja;
- gesel in drugih poverilnic – ključev API, prijavnih podatkov, žetonov za preverjanje pristnosti, podatkov plačilnih kartic in šifrirnih ključev;
- avtorsko zaščitenega gradiva – celotnih besedil knjig, plačljivih znanstvenih člankov ali skript, za katere uporabnik nima ustrezne licence;
- nezakonitih vsebin – gradiva, ki spodbuja nasilje ali sovraštvo, oziroma navodil za dejanja, ki kršijo veljavno zakonodajo.
Kaj se zgodi s podatki, ki jih vnesete v orodja AI?
Podatki, poslani ponudnikom storitev v oblaku, so lahko predmet večstopenjske obdelave in analize. Njihov življenjski cikel se ne konča z ustvarjenim odgovorom.
Učenje modelov
Podatki, vneseni v standardne potrošniške različice generativnih orodij, se pogosto uporabljajo za nadaljnje učenje modelov. Vnesene informacije lahko tako vplivajo na uteži nevronske mreže in se teoretično pojavijo v prihodnjem odgovoru povsem drugemu uporabniku.
Ročni pregled in moderiranje
Sistemi AI imajo poleg samodejne obdelave tudi varnostne filtre. Če algoritem poizvedbo oceni kot sumljivo, na primer kot kršitev pogojev uporabe, lahko pogovor označi in ga posreduje v ročni pregled. To pomeni, da lahko zaposleni pri ponudniku ali zunanji pregledovalci podatkov neposredno vidijo vneseno vsebino, da bi izboljšali postopke moderiranja.
Hramba podatkov in varnostne kopije
Ponudniki AI pogovore hranijo na svojih strežnikih zaradi zagotavljanja neprekinjenega delovanja storitev, odpravljanja napak in ohranjanja konteksta za prihodnje pogovore. Pomembno je, da izbris pogovora v uporabniškem vmesniku le redko pomeni takojšen izbris podatkov s strežnikov. Podatki še določen čas ostanejo v ponudnikovih varnostnih kopijah, kar poveča tveganje razkritja zaupnih informacij ob uspešnem kibernetskem napadu na infrastrukturo v oblaku.
Osebni in poslovni računi – razlike v ravni zaščite
Varnost podatkov pri uporabi AI se precej razlikuje glede na vrsto naročnine in način uvedbe.
Brezplačni in plačljivi standardni osebni računi pri številnih priljubljenih storitvah privzeto omogočajo uporabo poslanih informacij za učenje modelov. Če v pogovoru delite zaupno vsebino, zato obstaja tveganje, da nad njenim nadaljnjim širjenjem izgubite nadzor.
V poslovnih in podjetniških okoljih (na primer pri računih Enterprise in storitvah v zasebnih oblakih, ki uporabljajo API ponudnikov, kot so Microsoft Azure, AWS in Google Cloud) veljajo strožji standardi zaščite. Ponudniki zagotavljajo skladnost z varnostnimi standardi in predpisi (ISO 27001, SOC 2, GDPR) ter v pogodbah (SLA/DPA) določajo, da podatkov strank ne uporabljajo za učenje javno dostopnih osnovnih modelov. Omejitve glede vnosa podatkov so v takih okoljih lahko manj stroge, vendar sta še vedno potrebna politika obvladovanja tveganj in nadzor dostopa.
Kaj lahko varno vnesete v orodja AI?
Kljub številnim omejitvam lahko v orodja AI vnesete veliko vrst informacij, ne da bi razkrili zaupne podatke. Mednje spadajo:
- javno dostopno gradivo – članki iz odprtih virov, objave na blogih, javna tržna poročila, pravni akti in vsebine s spletnih strani, na primer z Wikipedije;
- nezaupne informacije – splošna navodila, vprašanja o teoretičnih pojmih, slovničnih in pravopisnih pravilih, matematične enačbe ter slovarska vprašanja;
- anonimizirani odlomki dokumentacije – predloge dopisov, vzorci pogodb ali odlomki programske kode, iz katerih so v celoti odstranjeni edinstveni podatki, ključi, imena strank in podatki o notranji arhitekturi;
- lastna ustvarjalna besedila – osnutki e-poštnih sporočil, objave za družbena omrežja, zasnove predstavitev ali članki, ki ne vsebujejo občutljivih poslovnih podatkov;
- odprte zbirke podatkov – sintetični podatki ali statistični podatki iz javnih repozitorijev, uporabljeni za učenje analize in oblikovanja podatkov.
Kako učinkovito anonimizirati sporočila in podatke, preden jih pošljete orodju AI?
Preden zaupne dokumente pošljete jezikovnemu modelu, jih ustrezno pripravite in iz njih odstranite občutljive informacije. Tako lahko delate z besedilom, ne da bi po nepotrebnem tvegali razkritje zaupnih podatkov.
Odstranjevanje identifikatorjev in zamenjava z oznakami
Pri tem postopku občutljive podatke nadomestite z izmišljenimi oznakami. Ime »Janez Novak« lahko na primer zamenjate z oznako »[Stranka_1]«, ime »Podjetje XYZ« pa z »[Organizacija_A]«. Jezikovnemu modelu tako ohranite strukturo, skladnjo in kontekst dokumenta, hkrati pa preprečite neposredno identifikacijo prvotnega subjekta.
Tehnike prikrivanja občutljivih informacij
Prikrivanje pomeni neposredno zakritje pomembnih nizov znakov, najpogosteje z njihovo zamenjavo s posebnimi znaki (na primer številka kartice 4532 **** **** ****). Učinkovita je tudi posplošitev podatkov: namesto natančne vrednosti, kot je plača 3.200 EUR, navedete razpon, na primer »plača med 3.000 in 4.000 EUR«. S tem zmanjšate tveganje ponovne identifikacije.
Avtomatizacija postopka (orodja DLP in RegEx)
Pri ročnem odstranjevanju informacij iz dolgih besedil zlahka kaj spregledate. V profesionalnih okoljih se zato uporabljajo skripti na podlagi regularnih izrazov (RegEx) ali sistemi DLP (preprečevanje izgube podatkov). Ta orodja lahko pred pošiljanjem samodejno pregledajo poziv ter zaznajo in blokirajo ali zamenjajo nize znakov v obliki številk EMŠO, davčnih številk, e-poštnih naslovov ali številk bančnih računov.
Kako preprečiti, da bi ponudniki orodij AI vaše podatke uporabljali za učenje modelov?
Tveganje, povezano z vnašanjem informacij v orodja AI, lahko zmanjšate tudi z ustreznimi nastavitvami. Večina ponudnikov omogoča, da izključite uporabo svojih vsebin za učenje modelov.
- ChatGPT (OpenAI) – v nastavitvah računa Settings, v razdelku Data controls, je možnost Improve the model for everyone. Če jo izklopite, se vnesena besedila ne uporabljajo za učenje modela. V trenutni različici vmesnika pogovori s tem ne izginejo iz vašega pogleda; zgodovina ostane na voljo. Ne glede na to nastavitev OpenAI dnevnike na svojih strežnikih še 30 dni hrani zaradi spremljanja zlorab in zagotavljanja varnosti, preden jih trajno izbriše.
- Gemini (Google) – v nastavitvah zasebnosti izklopite Gemini Apps Activity. Novi pogovori se tako ne shranjujejo v račun Google in se ne uporabljajo za učenje modelov. Sprememba pa ne izbriše dnevnikov iz ponudnikove infrastrukture: Google jih zaradi zagotavljanja varnosti storitve hrani do 72 ur.
- Claude (Anthropic) – pri brezplačnih in standardnih potrošniških različicah privzete nastavitve trenutno omogočajo uporabo vnesenih podatkov za izboljševanje modelov. To je pomembna sprememba glede na zgodnje obdobje podjetja, ko je Anthropic poudarjal, da pogovorov uporabnikov ne uporablja za učenje. Če želite to izključiti, v nastavitvah zasebnosti računa izklopite možnost Help improve Claude.
Upoštevajte, da spremembe nastavitev zasebnosti in izključitev uporabe podatkov za učenje veljajo le za naprej. Informacij, ki ste jih poslali pred spremembo in so bile že vključene v postopek učenja, s tem ne odstranite iz modela.
Povzetek
- Vsako interakcijo s potrošniškimi orodji AI obravnavajte kot javno objavo. Ne vnašajte osebnih podatkov, zdravstvene dokumentacije, gesel ali poslovnih skrivnosti.
- Poslane informacije se lahko uporabijo za učenje modelov in moderiranje ter hranijo na zunanjih strežnikih in v varnostnih kopijah.
- Za varnejše delo podatke predhodno anonimizirajte, prikrijte občutljive nize, jih nadomestite z oznakami ali uporabite namenska orodja DLP.
- Računi Enterprise in namenska poslovna okolja v oblaku zagotavljajo strožje standarde zaščite in določajo, da se podatki strank ne uporabljajo za učenje javno dostopnih modelov.
- Spremembe nastavitev zasebnosti in izključitev uporabe podatkov za učenje veljajo le za naprej; ne odstranijo podatkov, ki so bili morda že vključeni v učenje modela.
Vaš komentar je bil dodan in čaka na odobritev.
Warning: Undefined variable $aria_req in /home/platne/serwer291553/public_html/contentwriter.si/wp-content/themes/contentwriter/comments.php on line 51
Dodaj odgovor