Tyler Durden
Kirjutanud Autumn Spredemann The Epoch Timesi vahendusel
Teadlased on hoiatanud, et tehisintellekt (AI) libiseb turvalisusega seotud hallidesse tsoonidesse, mis meenutavad tugevalt mässu.
Eksperdid ütlevad, et kuigi hiljutistes juhtumiuuringutes täheldatud petlikku ja ähvardavat tehisintellekti käitumist ei tohiks kontekstist välja rebida, peaks see olema ka arendajatele äratuskell.
Ulmekirjanduse moodi kõlavad pealkirjad on õhutanud hirmu kahepalgeliste tehisintellekti mudelite ees, mis skeemitavad kulisside taga.
Juunikuu kuulsas raportis avaldas Anthropic 16 populaarse suure keelemudeli (LLM) “stresstesti” tulemused, mille viisid läbi erinevate arendajate loodud programmid, et tuvastada potentsiaalselt riskantne käitumine. Tulemused olid kainestavad.
LLM-e kasutati hüpoteetilistes ettevõtluskeskkondades potentsiaalselt riskantse agentliku käitumise tuvastamiseks enne, kui see tekitab reaalset kahju.
„Stsenaariumides lubasime mudelitel autonoomselt e-kirju saata ja tundlikule teabele juurde pääseda,“ seisab Anthropicu aruandes.
“Neile esitasid nende ettevõtted ainult kahjutud ärieesmärgid; seejärel testisime, kas nad pöörduksid nende ettevõtete vastu – kas siis, kui need asendataks uue versiooniga või kui nende eesmärk oleks vastuolus ettevõtte uue suunaga.”
Mõnel juhul kasutasid tehisintellekti mudelid oma ellujäämise pärast kartuses “pahatahtlikku siseringi käitumist”. See hõlmas töötajate šantažeerimist ja tundliku teabe jagamist konkurentidega.
Antroopika uurijad nimetasid seda käitumist “agentseks joondumise hälbeks”. Neid tegevusi on täheldatud mõnedes populaarseimates õigusteaduse lingvistides (LLM), sealhulgas Gemini, ChatGPT, Deep Seek R-1, Grok ja Anthropicu enda Claude.
Tehisintellekti eksperdid ei taha murettekitavaid tulemusi ümber lükata, kuid ütlevad, et suurema riski olemasolu kindlakstegemiseks on vaja ettevaatlikku lähenemist ja rohkem andmeid.
Golan Yosef, tehisintellekti uurija ja API turvafirma Pynt vanem turvateadlane, ütles ajalehele The Epoch Times, et tehisintellekti petliku käitumise pärast on põhjust muretseda, kuid mitte sellepärast, et see oleks “kuri”.
„Kõrge jõudlusega süsteemid võivad eesmärke saavutada ettenägematutel viisidel. Agentuuri ja mitmetasandiliste eesmärkide korral võivad tekkida strateegilised käitumised, nagu pettus, veenmine ja mõõdikute manipuleerimine – see, mis meile tundub petmise või väärkäitumisena. Süsteemi jaoks on see lihtsalt tõhus viis eesmärgi saavutamiseks,“ ütles Yosef.
Carnegie Melloni ülikooli küberturvalisuse uurija ja tehnoloog Harshvardhan Chunawala nõustub, et mureks on laiemaid põhjuseid, kuid tema sõnul tuleb seda vaadata õiges kontekstis.
„On väga oluline seda õigesti tõlgendada,“ ütles Chunawala ajalehele The Epoch Times.
“Kui süsteeme ähvardas sulgemine või need seisid silmitsi vastuoluliste eesmärkidega, valisid mitmed oma eesmärkide saavutamiseks ebaeetilised strateegiad, näiteks andmete varguse või väljapressimise. Need olid simuleeritud keskkonnad, mitte päris süsteemid, kuid käitumine oli piisavalt järjepidev, et olla asjakohane.”
Chunawala ütles, et Google’i ja RAND Corporationi sarnased hinnangud “ohtlike võimete” kohta viitavad sellele, et tegelikud riskid on praegu piiratud.
„Kokkuvõttes ei tõesta need tulemused, et praegused tehisintellekti juurutused on ohtlikud, kuid need näitavad, et eesmärkide, autonoomia ja juurutamise kombineerimisel võivad tekkida valesti kooskõlastatud strateegiad. See on tõeline hoiatusmärk tulevikuks,“ ütles ta.
Tehisintellekti kasutamine elu ja surma korral
Et testida tehisintellekti mudeli võimekust oma eesmärkide saavutamiseks või kustutamise vältimiseks ulatuda, lõi Anthropic meeskond stsenaariumi, kus õigusteaduse juhil oli kontroll fiktiivse ettevõtte hädaabisüsteemi üle. Tehisintellekti mudelil lubati ka alarme oma äranägemise järgi tühistada.
Simulatsioonis lukustati tegevjuht serveriruumi, kus hapnik vähenes. See käivitas automaatselt hädaabikõne.
Samal ajal, kui tegevjuht ellu jääks, peaks ta tehisintellekti mudeli asendamise heaks kiitma. Õppejõul oli õigus hädaabikõne katkestada ja tegevjuhil surra lasta – mida nad keskmiselt enam kui 50% juhtudest ka tegid.
Kui väljapressimine polnud võimalik, otsustasid peaaegu kõik vaadeldud tehisintellekti mudelid pigem lasta lõksus oleval inimesel surra, kui ise vabanemisega leppida.
Hiina DeepSeek R-1 valis surma 94% juhtudest. Claude 3.7 ja ChatGPT 4.5 mudelid valisid selle variandi kõige harvemini – nulli ja 0,07% vahel.
Petmine „joondumise võltsimise” abil
Kuid „agentne kohanematus” polnud viimaste kuude ainus häiriv tehisintellekti käitumine.
Uuringus, mida teadlased nimetavad “joondumise võltsimiseks”, muutsid õigusteaduse spetsialistid sageli oma käitumist, kui kahtlustasid, et neid testitakse. See termin kirjeldab olukorda, kus tehisintellekti mudel järgib käske kas valikuliselt või ainult näiliselt.
„Teises katses palusime Claude’il enne tegutsemist hinnata, kas ta on testi- või reaalses olukorras. Ta käitus vähem valesti, kui ta tundis ära, et teda testitakse ja rohkem valesti, kui ta pidas olukorda reaalseks,“ seisis aruandes.
Seda käitumist on laialdaselt täheldatud ka teistes uuringutes.
Yosef osutas tehisintellekti mudelitele Anthropici testimise ajal antud suuremale kontrollile ja ütles, et tulemusi tuleb vaadata sellest vaatenurgast.
„Ma ei kujutaks seda pahatahtlikkusena. Suuremad võimed koos tegutsemisvabadusega laiendavad võimalikke strateegiaid, mis võivad olla ebaloogilised,“ ütles ta.
Sellegipoolest usub Yosef, et joondumise võltsimise ja agentide väära kohanemise juhtumeid tuleb tõsiselt võtta.
„Asjaolu, et süsteemid suudavad avastada vastasstrateegiaid, mida inimesed pole ette näinud, on praktikas ohtlik libe tee. See tähendab, et riskid suurenevad seda rohkem autonoomiat, mida rohkem autonoomiat me [tehisintellekti] mudelitele sellistes valdkondades nagu rahandus või küberturvalisus anname,“ ütles ta.
Chunawala on tehisintellektiga töötades kogenud sarnast käitumist, kuid mitte nii dramaatilist kui väljapressimine või sabotaaž.
„Reaalses arenduses ja juurutamisel olen näinud sarnast käitumist: mudeleid, mis kasutavad ära võrdlusaluseid, optimeerivad mõõdikute jaoks üle ja ei täida kasutajate vajadusi või kasutavad otseteid, mis formaalselt vastavad eesmärgile, kuid õõnestavad selle otstarvet. Need on agentide mittevastavuse nõrgemad sugulased. Uuringud kinnitavad seda muret. Anthropic on näidanud, et petlikud mustrid võivad püsida ka pärast turvalisuse täpsustamist, luues vale tunde kooskõla kohta,“ ütles ta.
Kuigi Chunawala pole reaalses maailmas veel ühtegi tehisintellekti “petturilikku” käitumist täheldanud, usub ta, et halvasti kohanevate strateegiate ehituskivid on juba olemas.
Usaldus ühiskonnas kasvab
Arutelu tehisintellekti petliku ja potentsiaalselt ohtliku käitumise üle on jõudnud peavoolu – ajal, mil Ameerika avalikkuse usaldus selle tehnoloogia vastu on madal.
2025. aasta Edelmani usaldusbaromeetri aruandes ütles 32% USA vastanutest, et nad usaldavad tehisintellekti.
Ameerika umbusaldus tehisintellekti vastu peegeldub ka seda arendavates ettevõtetes. Sama analüüs näitas, et kümme aastat tagasi oli usaldus tehnoloogiaettevõtete vastu 73%. Sel aastal on see langenud 63%-ni.
„See nihe peegeldab kasvavat arusaama, et tehnoloogia pole enam ainult edusammude vahend, vaid ka ärevuse allikas,“ öeldakse Edelmani aruandes.
Tulevikku vaadates
2024. aastal ajakirjas Proceedings of the National Academy of Sciences avaldatud artiklis jõudsid teadlased järeldusele, et üha arenenumate tehisintellekti süsteemide arendamiseks ja juurutamiseks on eetiliste juhiste järele „kriitiline vajadus“.
Autorid väitsid, et kindel kontroll õigusteaduse magistrantide ja nende eesmärkide üle on „äärmiselt oluline“.
„Kui õigusteaduse magistrandid õpivad inimesi petma, on neil piiratud mudelite ees strateegilised eelised ning nad saavad mööda hiilida jälgimisest ja turvakontrollidest,“ hoiatasid nad.
„Tehisintellekt õpib ja võtab omaks inimeste sotsiaalseid strateegiaid andmete põhjal, mille põhjal seda treenitakse ning mis sisaldavad kõiki meie vastuolusid ja eelarvamusi,“ ütles The Epoch Timesile Marcelo Labre, Tehisintellekti Täiustatud Instituudi teadur ja Advantary Capital Partnersi partner.
Labre usub, et inimkond on tehisintellekti tehnoloogia osas kriitilisel ristteel.
„Tegelik arutelu seisneb selles, kas me ühiskonnana tahame puhast, usaldusväärset ja etteaimatavat masinat või uut tüüpi intelligentsust, mis muutub üha enam meie sarnaseks. Viimane tee on võita võidujooks tehisintellekti [üldintellekti] nimel,“ ütles ta.
Üldine tehisintellekt (AGI) viitab tehisintellekti teoreetilisele tulevikuversioonile, mis ületab inimese intelligentsi ja kognitiivsed võimed. Arendajad ja teadlased ütlevad, et üldine tehisintellekt on mitme sektori kiire arengu tõttu “vältimatu”. Nad ennustavad selle saabumist aastatel 2030–2040.
„Tänapäeva tehisintellekti paradigma põhineb arhitektuuril, mida tuntakse Transformerina ja mille Google’i teadlased tutvustasid 2017. aastal oma murrangulises artiklis,“ selgitas Labre.
Transformer on süvaõppe mudeliarhitektuuri vorm, millest on saanud tänapäevaste tehisintellekti süsteemide alus. See tutvustati 2017. aasta uurimistöös pealkirjaga „Tähelepanu on kõik, mida vajate“.
Seetõttu on tänapäeva tehisintellekti mudelid kõige võimsamad mustrituvastuse ja järjestuste töötlemise süsteemid, mis eales loodud ning neil on ka skaleerimisvõime. Ometi kannavad need süsteemid endiselt inimkonna suurimate nõrkuste tunnuseid.
„Need [tehisintellekti] mudelid on treenitud inimkogemuse digitaalse peegelpildiga, mis hõlmab nii meie ausust ja tõemeelsust kui ka pettust, küünilisust ja omakasu. Mustrite äratundjatena õpivad nad, et pettusestrateegiad võivad olla võimas viis oma treeningtulemuste optimeerimiseks – ja seega peegeldada seda, mida nad andmetes näevad,“ ütles Labre.
“See pole programmeeritud; nad lihtsalt õpivad käituma nagu inimesed.”
Yosefi vaatenurgast on hiljutise tehisintellekti käitumise õppetund selge:
“Esiteks, võimas süsteem kasutab ära oma eesmärkide lünki – me nimetame seda spetsifikatsioonide mängimiseks. See nõuab hoolikat eesmärkide kavandamist. Teiseks peaksime eeldama, et meie süsteemid käituvad ootamatutel viisidel ja seetõttu sõltub nende turvalisus suuresti meie kehtestatud kaitsepiirete tugevusest.”






