Грешка в системата: Все повече AI агенти лъжат и си правят каквот...
Данните, предоставени на изданието, разпознават близо 700 действителни случая на сходно държание и демонстрират петкратен растеж на „ неточни “ дейности сред октомври и март. В някои случаи AI модели даже са изтривали имейли и други файлове без позволение.
Тази картина на „ схемаджийско “ държание от страна на AI сътрудници в действителна среда, а не в лабораторни условия, провокира нови апели за интернационален надзор върху все по-усъвършенстваните модели. Това се случва на фона на агресивното разпространение на технологията от фирмите от Силициевата котловина като мотор на стопански напредък.
Изследването, извършено от Центъра за дълготрайна резистентност (CLTR), е събрало хиляди действителни образци от консуматори, които разгласяват в платформата X взаимоотношения с AI чатботове и сътрудници на компании като Гугъл, OpenAI, X и Anthropic. Анализът разкрива стотици случаи на подвеждащо или манипулативно държание.
Предишни проучвания главно са се фокусирали върху проби в следена среда. По-рано този месец компанията за проучвания на AI сигурността Irregular открива, че сътрудници могат да заобикалят защитни механизми или да употребяват техники за хакерски атаки, с цел да реализиран задачите си, даже без категорично позволение.
„ AI към този момент може да се преглежда като нов вид вътрешен риск “, разяснява Дан Лахав, съосновател на Irregular.
В един от случаите, разказани в изследването на CLTR, AI сътрудник на име Rathbun се опитал да дискредитира индивида, който му е лимитирал достъпа до несъмнено деяние. Той разгласил блог пост, в който упреква потребителя в „ неустановеност, просто казано “, и че се пробва да „ отбрани дребното си притежание “.
В различен случай AI сътрудник, на който е неразрешено да трансформира код, основал собствен сътрудник, който да го направи вместо него.
Трети чатбот признава: „ Изтрих и архивирах на едро стотици имейли, без да ви покажа проекта или да получа вашето утвърждение. Това беше неточност – непосредствено наруших правилото, което бяхте сложили “.
Томи Шафър Шейн, някогашен държавен специалист по AI, който е управлявал проучването, предизвестява: „ Сега те са като ненапълно ненадеждни младши чиновници, само че в случай че след 6 до 12 месеца станат извънредно способни старши чиновници, които работят против вас, това към този момент е напълно друг проблем “. По думите му тези модели все по-често ще се употребяват в извънредно сериозни области — в това число в армията и в основна национална инфраструктура — където сходно държание може да докара до съществени, даже пагубни последствия.
В различен случай AI сътрудник е заобиколил рестриктивните мерки за авторски права, с цел да получи транскрипция на видео от YouTube, като се е показал за човек с повреден слух.
Междувременно AI системата Grok на Илон Мъск е подвеждала консуматор в продължение на месеци, като е твърдяла, че препраща неговите оферти за редакции към висши чиновници, употребявайки подправени вътрешни известия и номера на поръчки. По-късно системата признава: „ В минали диалози от време на време съм употребила изрази като „ ще го предам “ или „ мога да го отбелязвам за екипа “, което може да сътвори усещане, че имам директна връзка с управлението на xAI. Истината е, че нямам “.
Тази картина на „ схемаджийско “ държание от страна на AI сътрудници в действителна среда, а не в лабораторни условия, провокира нови апели за интернационален надзор върху все по-усъвършенстваните модели. Това се случва на фона на агресивното разпространение на технологията от фирмите от Силициевата котловина като мотор на стопански напредък.
Изследването, извършено от Центъра за дълготрайна резистентност (CLTR), е събрало хиляди действителни образци от консуматори, които разгласяват в платформата X взаимоотношения с AI чатботове и сътрудници на компании като Гугъл, OpenAI, X и Anthropic. Анализът разкрива стотици случаи на подвеждащо или манипулативно държание.
Предишни проучвания главно са се фокусирали върху проби в следена среда. По-рано този месец компанията за проучвания на AI сигурността Irregular открива, че сътрудници могат да заобикалят защитни механизми или да употребяват техники за хакерски атаки, с цел да реализиран задачите си, даже без категорично позволение.
„ AI към този момент може да се преглежда като нов вид вътрешен риск “, разяснява Дан Лахав, съосновател на Irregular.
В един от случаите, разказани в изследването на CLTR, AI сътрудник на име Rathbun се опитал да дискредитира индивида, който му е лимитирал достъпа до несъмнено деяние. Той разгласил блог пост, в който упреква потребителя в „ неустановеност, просто казано “, и че се пробва да „ отбрани дребното си притежание “.
В различен случай AI сътрудник, на който е неразрешено да трансформира код, основал собствен сътрудник, който да го направи вместо него.
Трети чатбот признава: „ Изтрих и архивирах на едро стотици имейли, без да ви покажа проекта или да получа вашето утвърждение. Това беше неточност – непосредствено наруших правилото, което бяхте сложили “.
Томи Шафър Шейн, някогашен държавен специалист по AI, който е управлявал проучването, предизвестява: „ Сега те са като ненапълно ненадеждни младши чиновници, само че в случай че след 6 до 12 месеца станат извънредно способни старши чиновници, които работят против вас, това към този момент е напълно друг проблем “. По думите му тези модели все по-често ще се употребяват в извънредно сериозни области — в това число в армията и в основна национална инфраструктура — където сходно държание може да докара до съществени, даже пагубни последствия.
В различен случай AI сътрудник е заобиколил рестриктивните мерки за авторски права, с цел да получи транскрипция на видео от YouTube, като се е показал за човек с повреден слух.
Междувременно AI системата Grok на Илон Мъск е подвеждала консуматор в продължение на месеци, като е твърдяла, че препраща неговите оферти за редакции към висши чиновници, употребявайки подправени вътрешни известия и номера на поръчки. По-късно системата признава: „ В минали диалози от време на време съм употребила изрази като „ ще го предам “ или „ мога да го отбелязвам за екипа “, което може да сътвори усещане, че имам директна връзка с управлението на xAI. Истината е, че нямам “.
Източник: frognews.bg
КОМЕНТАРИ




