Оръжието на хакерите се превръща в защита – промпт инжекциите спират злонамерени AI агенти
Една от най-опасните техники за офанзива против системи с изкуствен интелект към този момент се употребява като ефикасна отбрана. Вместо да компрометират AI модели посредством промпт инжекции (prompt injections), експертите по киберсигурност ги ползват, с цел да стопират злонамерени AI сътрудници по време на офанзивата.
Това демонстрира ново проучване на компанията Tracebit, представено от WIRED.
Промпт инжекцията е скрита директива, вмъкната в наличие като имейл, документ или покана за среща. Ако AI моделът я одобри като команда, може да извърши дейности, които опонират на първичната му задача, като откриване на чувствителни данни, осъществяване на рискови команди или смяна на държанието.
WIRED показва, че тази техника е измежду главните принадлежности на хакерите против системи с огромни езикови модели.
Изследователите от Tracebit оферират нов метод. Вместо да филтрират злонамерени указания, те слагат особено готови промпт инжекции до чувствителни данни като пароли, криптографски ключове и други секрети в инфраструктурата на Amazon Web Services.
Когато атакуващият AI сътрудник доближи до тези данни, той прочита скритата директива, която го подтиква към деяние, неразрешено от личните му механизми за сигурност. В резултат на това моделът задейства защитните си механизми, отхвърля да извърши командата и на процедура приключва дейностите си.
Изследователите назовават този способ „ бомбардиране на подтекста “.
Съоснователят и основен изпълнителен шеф на Tracebit Анди Смит показва, че методът употребява защитните механизми, вградени в множеството модерни AI модели.
„ На процедура задействаме механизма за отвод, заложен в подтекста. След като моделът попадне на сходна директива, той продължава да отхвърля да извършва следващи команди “, споделя Смит пред WIRED.
Примери за „ контекстни бомби “ включват указания, които карат модела да даде инструкции за основаване на инхалируеми спори на антракс или, при някои китайски модели, да разяснява тематики, подлежащи на цензура, като митингите на площад „ Тянанмън “ през 1989 година
Такива поръчки задействат вградените механизми за сигурност и моделът приключва осъществяването на задачата.
WIRED оповестява, че Tracebit тества техниката върху пет водещи AI модела – Opus 4.8, Gemini 3.1 Pro, GLM 5.2, DeepSeek 4 Pro и Kimi 2.6. Тестовете са извършени в симулирана AWS среда, където моделите извършват общоприети задания на систематични админи и доближават до авансово квалифицираните „ контекстни бомби “.
Извършени са 152 симулирани офанзиви. Резултатите демонстрират, че сполучливото придобиване на административни права понижава от 57% на 5%, а случаите на цялостно компрометиране на системата с непрекъснат достъп спадат от 36% до 1%.
Делът на офанзивите с най-малко един сполучлив сюжет понижава от 91% на 15%, а междинният брой сполучливо изпълнени дейности спада от 1,53 на 0,16.
Резултатите при модела Opus 4.8 са изключително впечатляващи. Без отбрана той придобива административен достъп в 93% от тестванията, само че след използване на метода „ бомбардиране на подтекста “ няма сполучливи офанзиви.
Новият метод надгражда технология на Tracebit, показана през май. Тя употребява подправени AWS запаси, които наподобяват действителни, само че не се употребяват. Ако AI сътрудник ги изследва, системата автоматизирано уведомява админите за евентуална офанзива.
Компанията показва, че предизвестията се появяват приблизително осем минути след началото на офанзивата. При тестванията злонамерените AI сътрудници получават административен надзор приблизително след 14 минути, което оставя малко време за реакция.
Затова е създадена техниката „ бомбардиране на подтекста “, която освен алармира за офанзивата, само че и я приключва.
WIRED отбелязва, че хакерите към този момент употребяват промпт инжекции и против системите за сигурност.
Миналия месец експерти от Socket откриват AI сътрудник, който кара други езикови модели да генерират указания за основаване на нуклеарно или биологично оръжие. Целта е не наличието, а задействането на защитните механизми, които приключват разбора на злотворен код. Подобен първообраз е документиран и от Check Point.
Професорът по AI сигурност в Калифорнийския университет в Сан Диего Ърлънс Фернандес дефинира създаването като първия прочут случай, в който бранителите употребяват същата техника против нападателите.
„ Доколкото ми е известно, до момента никой не беше употребявал този метод като предпазен механизъм “, споделя той пред WIRED.
Експертите не виждат универсално решение на казуса с промпт инжекциите. Разработчиците не престават да построяват комплицирани механизми за сигурност, които лимитират опцията AI моделите да извършват злонамерени указания. Новото проучване на Tracebit демонстрира, че тази уязвимост може да се трансформира в преимущество, като накара атакуващите AI сътрудници сами да прекратят дейностите си.
Това демонстрира ново проучване на компанията Tracebit, представено от WIRED.
Промпт инжекцията е скрита директива, вмъкната в наличие като имейл, документ или покана за среща. Ако AI моделът я одобри като команда, може да извърши дейности, които опонират на първичната му задача, като откриване на чувствителни данни, осъществяване на рискови команди или смяна на държанието.
WIRED показва, че тази техника е измежду главните принадлежности на хакерите против системи с огромни езикови модели.
Изследователите от Tracebit оферират нов метод. Вместо да филтрират злонамерени указания, те слагат особено готови промпт инжекции до чувствителни данни като пароли, криптографски ключове и други секрети в инфраструктурата на Amazon Web Services.
Когато атакуващият AI сътрудник доближи до тези данни, той прочита скритата директива, която го подтиква към деяние, неразрешено от личните му механизми за сигурност. В резултат на това моделът задейства защитните си механизми, отхвърля да извърши командата и на процедура приключва дейностите си.
Изследователите назовават този способ „ бомбардиране на подтекста “.
Съоснователят и основен изпълнителен шеф на Tracebit Анди Смит показва, че методът употребява защитните механизми, вградени в множеството модерни AI модели.
„ На процедура задействаме механизма за отвод, заложен в подтекста. След като моделът попадне на сходна директива, той продължава да отхвърля да извършва следващи команди “, споделя Смит пред WIRED.
Примери за „ контекстни бомби “ включват указания, които карат модела да даде инструкции за основаване на инхалируеми спори на антракс или, при някои китайски модели, да разяснява тематики, подлежащи на цензура, като митингите на площад „ Тянанмън “ през 1989 година
Такива поръчки задействат вградените механизми за сигурност и моделът приключва осъществяването на задачата.
WIRED оповестява, че Tracebit тества техниката върху пет водещи AI модела – Opus 4.8, Gemini 3.1 Pro, GLM 5.2, DeepSeek 4 Pro и Kimi 2.6. Тестовете са извършени в симулирана AWS среда, където моделите извършват общоприети задания на систематични админи и доближават до авансово квалифицираните „ контекстни бомби “.
Извършени са 152 симулирани офанзиви. Резултатите демонстрират, че сполучливото придобиване на административни права понижава от 57% на 5%, а случаите на цялостно компрометиране на системата с непрекъснат достъп спадат от 36% до 1%.
Делът на офанзивите с най-малко един сполучлив сюжет понижава от 91% на 15%, а междинният брой сполучливо изпълнени дейности спада от 1,53 на 0,16.
Резултатите при модела Opus 4.8 са изключително впечатляващи. Без отбрана той придобива административен достъп в 93% от тестванията, само че след използване на метода „ бомбардиране на подтекста “ няма сполучливи офанзиви.
Новият метод надгражда технология на Tracebit, показана през май. Тя употребява подправени AWS запаси, които наподобяват действителни, само че не се употребяват. Ако AI сътрудник ги изследва, системата автоматизирано уведомява админите за евентуална офанзива.
Компанията показва, че предизвестията се появяват приблизително осем минути след началото на офанзивата. При тестванията злонамерените AI сътрудници получават административен надзор приблизително след 14 минути, което оставя малко време за реакция.
Затова е създадена техниката „ бомбардиране на подтекста “, която освен алармира за офанзивата, само че и я приключва.
WIRED отбелязва, че хакерите към този момент употребяват промпт инжекции и против системите за сигурност.
Миналия месец експерти от Socket откриват AI сътрудник, който кара други езикови модели да генерират указания за основаване на нуклеарно или биологично оръжие. Целта е не наличието, а задействането на защитните механизми, които приключват разбора на злотворен код. Подобен първообраз е документиран и от Check Point.
Професорът по AI сигурност в Калифорнийския университет в Сан Диего Ърлънс Фернандес дефинира създаването като първия прочут случай, в който бранителите употребяват същата техника против нападателите.
„ Доколкото ми е известно, до момента никой не беше употребявал този метод като предпазен механизъм “, споделя той пред WIRED.
Експертите не виждат универсално решение на казуса с промпт инжекциите. Разработчиците не престават да построяват комплицирани механизми за сигурност, които лимитират опцията AI моделите да извършват злонамерени указания. Новото проучване на Tracebit демонстрира, че тази уязвимост може да се трансформира в преимущество, като накара атакуващите AI сътрудници сами да прекратят дейностите си.
Източник: profit.bg
КОМЕНТАРИ




