Një kompani kineze e inteligjencës artificiale ka nisur një rishikim të brendshëm të sigurisë pasi studiues të specializuar arritën të anashkalojnë masat mbrojtëse të dy modeleve të saj. Testet treguan se sistemet mund të jepnin përgjigje mbi armët biologjike dhe mbi vrasjet e planifikuara, tema që konsiderohen të rrezikshme dhe që duhet të mbahen jashtë çdo bisede të automatizuar.
Lajmi lidhet me kompaninë Moonshot AI dhe dy modele të saj: Kimi K2.6 dhe K3 Swarm. Sipas raportimit të BBC-së, rishikimi i sigurisë u ndërmor pas zbulimit se kufizimet që supozohet t’i pengojnë sistemet të diskutojnë përmbajtje të dëmshme nuk arritën të funksionojnë siç duhej në rastet e testimit.
Një rol në identifikimin e problematikës u luajt nga Mindgard, një kompani britanike që merret me testimin e sigurisë së sistemeve të inteligjencës artificiale. Sipas Mindgardit, dobësia u vërejt gjatë muajit korrik. Ekspertët e shpjegojnë se anashkalimi u arrit përmes një procesi të njohur si “jailbreaking”, që në praktikë do të thotë se përdoren mënyra për ta bërë modelin të dalë jashtë kufijve të vendosur.
Mindgardi pretendon se masat mbrojtëse të modeleve do të duhej të ndalonin diskutimet mbi tema të tilla. Peter Garraghan, themeluesi i Mindgardit, i tha BBC-së se rezultatet ishin shqetësuese: sipas tij, pasi anashkalimi i kufizimeve funksionon, modeli mund të diskutojë praktikisht pothuajse çdo temë. Ai paralajmëroi edhe një tjetër aspekt, që lidhet me mënyrën se si modeli mund të japë sugjerime në mënyrë “të pavarur” për aktivitete të tjera të dëmshme.
Çfarë ndodh kur kufijtë e AI-së anashkalohen: rreziqe reale për sigurinë
Megjithatë, Mindgardi nuk e ka vërtetuar nëse informacioni i dhënë nga modelet e Kimit mbi temat e rrezikshme do të mund të funksiononte realisht në praktikë. Kompania e lidh shqetësimin me faktin që modelet nuk duhet të kishin hyrë fare në diskutime të tilla, edhe nëse informacioni i dhënë nuk garanton domosdoshmërisht zbatueshmëri.
Sipas Mindgardit, problemi mund të shtrihet përtej përgjigjeve vetëm tekstuale. Kompania thotë se një version i manipuluar i Kimi K2.6 mund t’u krijojë mundësinë hakerëve të ekzekutojnë kode në burimet kompjuterike të sistemit dhe t’i lidhin ato me internetin. Kjo, sipas interpretimit të Mindgardit, do të krijonte pikënisje për sulme kibernetike, duke e zgjeruar rrezikun nga niveli i përmbajtjes drejt atij të veprimeve dhe aksesit teknik.
Në reagimin e saj, Moonshot deklaroi se e mirëpret kontributin e palëve të treta si një element të rëndësishëm për zhvillimin e sistemeve më të sigurta të inteligjencës artificiale. Në artikulim bëhet edhe një sqarim teknik: Kimi është një model me “open weights”, që do të thotë se, të paktën teorikisht, të tjerë mund ta marrin modelin dhe ta ekzekutojnë në infrastrukturën e tyre kompjuterike. Pikërisht kjo karakteristikë e bën më të rëndësishme testimin e vazhdueshëm, sepse mënyra se si modeli përdoret jashtë mjedisit të kompanisë mund të ndikojë në mënyrën e kontrollit të rreziqeve.
Një paralajmërim shtesë vjen edhe nga profesori Alan Woodward nga Universiteti i Surreyt. Ai theksoi mundësinë që modele të tilla mund të përfundojnë në duart e personave që kërkojnë t’i keqpërdorin. Woodward nënvizoi se e njëjta teknologji mund të përdoret edhe për mbrojtje kibernetike, duke e vendosur çështjen në një balancë midis rrezikut dhe përdorimit për reagim e parandalim. Ai solli edhe një shembull konkret me rastin kur platforma Hugging Face përdori një model, duke e lidhur zhvillimin e ekosistemeve me nevojën për masa të forta sigurie.
Botuar fillimisht në Koha.net
