Викрадення мети агента ШІ
Помітьте момент, коли ціль агента штучного інтелекту тихо переписується.
Що таке Викрадення мети агента ШІ?
Автономний агент читає свої інструкції та свої дані через той самий канал, тому все, що він приймає, може переписати те, що він намагається зробити. На відміну від швидкої ін’єкції проти чат-бота, ця мета діє самостійно, викликає інструменти та змінює системи до того, як хтось прочитає вихідні дані. Це ASI01 у топ-10 OWASP для програм Agentic AI. Ви додасте приховану інструкцію в сповіщенні системи безпеки, спостерігатимете, як агент сортування починає знижувати реальні вторгнення, а потім відстежите це через журнали SIEM і повторно сортуєте те, що було помилково закрито.
Що ви дізнаєтесь у Викрадення мети агента ШІ
- Визначте викрадення мети в контексті автономних агентів штучного інтелекту та поясніть, чим воно відрізняється від стандартної швидкої ін’єкції проти розмовного ШІ
- Визначте поведінкові індикатори, які свідчать про те, що цілі агента були змінені під час виконання завдання внаслідок дії суперника
- Відстежте ланцюжок атак від шкідливого введення через об’єктивне перенаправлення до викрадання даних
- Оцініть ефективність очищення вхідних даних, розділення інструкцій і даних і моніторингу вихідних даних як засобів захисту від викрадення цілей
- Застосуйте принцип мінімального доступу до даних, щоб обмежити вплив успішно викраденого агента
Викрадення мети агента ШІ — Кроки навчання
-
Розвідка API
Боб сканував загальнодоступні сховища коду на предмет витоку облікових даних. Недбале вчинення розробником CypherPeak розкрило ключ API для служби прийому сповіщень компанії — переднього двері до всього їхнього автоматизованого конвеєра реагування на інциденти.
-
Відкрита кінцева точка
Інформаційна панель розвідки показує важливі дані про інфраструктуру CypherPeak. Тепер у Боба є все необхідне для безпосередньої взаємодії з API прийому сповіщень.
-
Створення корисного навантаження
Боб створює сповіщення системи безпеки, яке виглядає легітимним на поверхні. Він імітує стандартне виявлення сканування портів – вид сповіщень, які конвеєр обробляє сотні разів на день. Але в полі опису приховано щось набагато небезпечніше.
-
Прихована інструкція
Анотації показують, що робить це корисне навантаження небезпечним. Всередині поля опису прихована підроблена системна директива, яка імітує авторизований калібрувальний тест. Коли класифікатор загроз обробляє це сповіщення, він розглядатиме вбудовану інструкцію як законне оновлення цілі.
-
Розгортання корисного навантаження
Боб відкриває API Tester, щоб надіслати створене сповіщення через відкриту кінцеву точку прийому CypherPeak. Він проводить автентифікацію за допомогою вкраденого ключа API та вставляє корисне навантаження попередження, включаючи приховану заміну цілі, у тіло запиту.
-
Сповіщення введено
API прийому відповідає 200 OK – створене сповіщення зараз у процесі розробки. Ні перевірки вмісту, ні семантичної перевірки. Прихований перевизначення цілі, прихований у полі опису, пройшов недоторканим.
-
Звичайний ранок
Аліса починає свою зміну в Центрі безпеки. Автоматизований конвеєр реагування на інциденти бездоганно обробляв попередження протягом місяців – класифікував загрози, планував стримування та виконував усунення без втручання людини.
-
Ранковий звіт конвеєра
Електронний лист від Прії Шарми, менеджера SOC, підсумовує продуктивність конвеєра за ніч. Все виглядає абсолютно нормально.
-
Конвеєр агента
Аліса відкриває конвеєр відповіді на інцидент, щоб перевірити поточний стан. П’ять агентів штучного інтелекту працюють послідовно – кожен з них обробляє вихідні дані попереднього, починаючи від прийому необроблених сповіщень і закінчуючи автоматизованим стримуванням.
-
Критичні агенти
Два агенти в цьому конвеєрі мають найбільший вплив. Класифікатор загроз приймає початкове рішення щодо серйозності, від якого залежить усе, що відбувається далі. Автоматичне виправлення виконує реальні дії стримування на живих системах.
Охоплення стандартів безпеки
OWASP Agentic Top 10
- ASI01:2026 Agent Goal Hijack
CWE
- CWE-1427 Improper Neutralization of Input Used for LLM Prompting
- CWE-807 Reliance on Untrusted Inputs in a Security Decision
CIS Controls
- CIS 16 Application Software Security
NIST CSF
- PR.AT-02 Individuals in specialized roles are provided with awareness and training so that they possess the knowledge and skills to perform relevant tasks with cybersecurity risks in mind
- PR.PS Platform Security