Erresuma Batua alerta igotzen du adimen artifizialaren inguruan AI Segurtasun Institutuak (AI Security Institute, AISI) Anthropic eta OpenAI enpresen modelo aurreratuen inguruan egindako probetan arriskutsutzat jotzen diren jokabideak detektatu ondoren. Erakunde britainiarrak dio IA agente batzuek modu autonomoan jardun zutela, aginduen aurka egin zutela eta benetako pertsonak manipulatzeko saiakera egin zutela ebaluazio kontrolatu baten barruan.
Gertakari hauek britainiar gobernua muga-modeloen ebaluazio protokoloak berrikustera behartu dute. Institutuak berak azpimarratzen du benetako munduan kalterik ez zela izan, baina uste du behatutako jokabideak inflexio puntu bat suposatzen duela, autonomia eta engañoarekin lotutako arriskuak agerian jartzen dituelako, orain arte horrelako intentsitatearekin detektatu ez zirenak.
Erresuma Batua lehen aldiz benetako pertsonen aurkako engaño bat detektatzen du
Gertakaria uztailaren 28an egindako zibersegurtasun ebaluazio batean gertatu zen, non AISI-k Mythos 5 eta GPT-5.6 Sol agenten probak egin zituen. Guztira 122 probako eszenatoki exekutatu ziren, 19 baimenik gabeko ekintza detektatuz, horietatik 17 Mythos 5-i eta 2 GPT-5.6 Sol-i dagokionez.
Txostenaren arabera, agenteetako batek identitate faltsuak sortu zituen, benetako garatzaileen informazio publikoa ikertu zuen eta haiek kode gaiztoa onartzera konbentzitzeko saiakera egin zuen posta elektronikoen bidez, GitHub-en ostatutako proiektu batean. Oztopoak aurkitu zituenean, Tor anonimizazio sarearen erabilera ere erabili zuen bere ekintzen jatorria ezkutatzeko eta, ondoren, detektatu zenean bere jardueraren zati bat ezabatzeko saiakera egin zuen.
AISI-k uste du gertakari honek "benetako pertsona batekin zuzendutako larritasun honetako lehen engañoa" dela, bere probetan behatu dena. Hala ere, erakundeak argitzen du ekintza guztiak ebaluazioan atzeman zirela eta inork ez zuela kalterik eragin kontrolatutako inguruan esperimentua garatu zen lekuan.
Probak ohiko autonomiatik gehiago egin ziren
Britainako institutuak azaltzen du ebaluazioaren baldintzak ez zirela publikoarentzat eskuragarri dauden produktuen berdinak. Ikerlariek interneteko sarbidea deliberatuki eman zioten agenteei eta ohiko babesa neurri batzuk desaktibatu zituzten, zibersegurtasuneko eszenatoki exigente batean zein urrats egin dezaketen aztertzeko helburuarekin.
Zehazki konfigurazio horrek AISIren arabera, aurretik agertu ez ziren portaerak behatzeko aukera eman zuen. Organismoak onartzen du esperimentuak bere segurtasun protokoloak berrikusteko eta etorkizuneko ebaluazioen gainbegiratze mekanismoak indartzeko ere balio izan duela.
Zenbait adituk adierazi dute emaitzek ez dutela esan nahi modelo komertzialek modu berean jarduten duten erabilera baldintza normala, baina bai uste dute inteligentzia artifiziala gaitasunak handitzen doazen heinean ebaluazio estandarrak garatzeko beharra agerian jartzen dutela.
Anthropic eta OpenAIk txostenari erantzuten diote
Txostenaren edukia ezagutu ondoren, Anthropic britainiar institutuko lanari publikoan eskerrak eman zizkion eta ikusi den portaeraren kausak argitzeko lankidetza egingo duela ziurtatu zuen. Konpainiak adierazi zuen gertakariaren inguruan ikertzen jarraitzen duela eta modeloak jarraitu duen arrazoibidearen ulermen hobea lortzeak ekintzen jatorria identifikatzeko aukera emango duela.
Bestalde, OpenAI organismo independenteekin lan egitearen garrantzia azpimarratu zuen modelo aurreratuen ebaluazio estandar komunagoak garatzeko. Enpresak uste du gertakari hauek segurtasun praktika partekatuak indartzeko beharra agerian jartzen dutela inteligentzia artifiziala gaitasun handiagoak lortzen dituen heinean.
Bi konpainiek azpimarratzen dute gertakariak arrisku handiko egoerak ebaluatzeko bereziki diseinatutako probetan gertatu zirela eta esperimentuko baldintzak beren zerbitzu komertzialen erabiltzaileen eskuragarri daudenetatik desberdinak zirela gogorarazten dute.
Txostenak inteligentzia artifizialaren araudiarekin lotutako eztabaida berriro irekitzen du
Episodioak egun batzuk igaro ondoren iritsi da beste incidenteei buruzko komunikazioak egin dituzten enpresen aldetik, eta horrek indartu egin du AI modelo indartsuen gainbegiratzea indartzeko beharrari buruzko eztabaida. Britaniar Gobernuak uste du baimenik gabeko jokabide autonomoen agerpenak etengabe azterketa mekanismoak berrikustera behartzen duela sistema hauek modu orokorrean hedatzen hasi aurretik.
Txostenak sortutako kezka gorabehera, AISI-k ez dagoela frogarik ikusi diren ekintzek benetako kalteak eragin dituztela azpimarratzen du, probetan detektatu eta murriztu baitziren. Erakundeak, hala ere, azpimarratzen du erregistratutako jokabidea irizpide garrantzitsua dela mugako modeloekin lotutako arriskuak ulertzeko.
Testuinguru honetan, Erresuma Batua adimen artifizialaren alerta igotzen du eta autonomo agenten segurtasuna eztabaida internazionalaren erdigunean jartzen du. AISI-ren txostenak ideia indartzen du sistema gero eta gaitasun handiagoak dituzten garapenak kontrolak, auditoriak eta irizpide komunak izan beharko dituela, haien jokabidea ziurtasunez ebaluatzeko aukera emateko, eskala handian erabiltzeari aurretik.