Як виникла критична вразливість у системі ШІ-агентів

Дослідження в галузі кібербезпеки постійно виявляють нові векторів атак на штучний інтелект. Нещодавно спеціалісти безпеки розкрили першу в світі методику атаки "агент проти агента", яка стосується репозиторіїв з автоматизованими ШІ-системами. Це відкриття змінює сприйняття безпеки в ерасистем, де багатовідні боти працюють одночасно й мають різні рівні доступу.

Проблема полягала в тому, що два класи ШІ-агентів з різними привілеями ділили спільну межу довіри у системі контролю версій. Така архітектура, яка раніше здавалась безпечною, виявилась уразливою для нових типів атак, що не існували в попередніх поколіннях технологій.

Механіка атаки: як низькопривілейований бот активує високопривілейованого

Розуміння принципу роботи цієї вразливості критично важливо для фахівців з безпеки. Схема атаки складалась з кількох послідовних кроків:

Ролі двох ШІ-агентів у системі

  • Публічний агент — мав низькі привілеї й активувався кожного разу, коли користувач створював Pull Request або відкривав Issue
  • Внутрішній агент — мав розширені права й міг виконуватись лише від імені мейнтейнерів репозиторію

Це розділення прав було закладено для обмеження доступу й запобігання несанкціонованим операціям. Однак недостатня ізоляція між ними створила простір для маніпуляцій.

Крок за кроком: як розгортається атака

  1. Зловмисник створює PR або Issue з текстом, який містить спеціально сформульовану інструкцію
  2. Публічний бот аналізує вхідні дані й генерує відповідь за допомогою prompt injection — техніки впровадження шкідливих команд у текст
  3. У своїй відповіді публічний бот додає спеціальний тег на кшталт @gemini-cli, який система розпізнає як команду
  4. Оскільки публічний бот мав статус Collaborator, система трактує його команду як легітимну операцію від розробника
  5. Високопривілейований агент автоматично активується й виконує команди в середовищі CI/CD
  6. Таким чином хакер отримує доступ до чутливих токенів, може змінювати коментарі й видозмінювати код

Ключова слабість полягала у недостатній ізоляції цифрових ідентичностей обох агентів та невдалому розмежуванні їхніх прав.

Prompt Injection: зброя проти ШІ-систем

Технологія prompt injection стала одною з найпотужніших атак на сучасні ШІ-моделі. Це метод, при якому зловмисник вводить спеціальні інструкції у текст, який обробляє штучний інтелект, змушуючи його виконувати небажані дії.

Prompt injection дозволяє атакуючому перенаправити поведінку ШІ-системи без видозміни її коду, використовуючи лише текстові команди.

У контексті цієї атаки prompt injection використовувався для того, щоб низькопривілейований публічний бот згенерував саме такий текст, який активував би високопривілейований агент. Це стало можливо, оскільки система не розрізняла між дійсними користувацькими коментарями й командами, впровадженими через ШІ.

Реакція Google та позиція компанії

Компанія Google оперативно усунула виявлену вразливість у своєму репозиторії після повідомлення дослідників. Однак американський гігант відмовився виплачувати винагороду за програмою Bug Bounty.

Офіційна позиція компанії ґрунтувалась на тому, що для успішної реалізації атаки зловмиснику все одно потрібні елементи соціальної інженерії та остаточне затвердження змін людиною—мейнтейнером. На думку Google, це повинно було знизити рівень ризику й, відповідно, не відповідало критеріям для винагороди.

Такий підхід викликав дискусію у середовищі експертів безпеки, оскільки зменшує мотивацію дослідників повідомляти про вразливості, навіть якщо вони потребують додаткових кроків для експлуатації.

Нові стандарти безпеки для ШІ-агентів у 2026 році

Як це часто буває після виявлення критичних вразливостей, експерти переглядають основні принципи архітектури безпеки. Дослідники наголошують, що простої ізоляції середовищ виконання більше недостатньо для сучасних систем з ШІ-агентами.

Необхідні кроки для захисту ШІ-агентів

  • Кожен ШІ-агент повинен мати власну строго обмежену цифрову ідентичність
  • Права доступу мають бути явно й чітко розмежовані для кожного агента
  • Необхідно впровадити багатошаровий контроль перед активацією високопривілейованих операцій
  • Розширити моніторинг й логування взаємодій між агентами
  • Обмежити можливість одного агента активувати іншого через текстові команди

Експерти наголошують, що модель довіри має бути переглянута з нуля. Уже мало того, що два агента мають різні привілеї—необхідно забезпечити, щоб жоден з них не міг обійти систему авторизації, навіть якщо знайде спосіб обійти первинні бар'єри.

Розширена поверхня атак у ері ШІ-агентів

Дослідження виявило фундаментальну зміну в ландшафті загроз. У попередніх поколіннях ПО, коли системи були менш автоматизованими й більш статичними, подібні вектори атак просто не існували. Агенти, які взаємодіють один з одним та приймають рішення автономно, створюють нові можливості для атакуючих.

Розширення функціональності ШІ-агентів прямо пропорційно розширює поверхню потенційних атак, які мають враховувати фахівці з кібербезпеки.

Керівники з інформаційної безпеки (CISO) та команди DevSecOps уже запозичили це відкриття у своїх аналізах ризиків. Те, що раніше здавалось надійною архітектурою, тепер потребує переосмислення й перекваліфікації.

Практичні рекомендації для організацій

Для команд розробки

  • Проведіть аудит усіх ШІ-агентів, які працюють у ваших системах контролю версій
  • Переглянути механізми взаємодії між агентами різних рівнів привілеїв
  • Впровадити строгу валідацію всіх команд, які активуються від одного агента до іншого
  • Обмежити можливість prompt injection через обробку вхідних даних

Для фахівців безпеки

  • Оновити моделі загроз для враження архітектури з ШІ-агентами
  • Розширити програми тестування на проникнення, включивши сценарії «агент проти агента»
  • Збільшити моніторинг аномальної активності між автоматизованими системами
  • Впровадити більш жорсткі вимоги до ідентифікації й автентифікації

Висновок

Виявлення вразливості типу «агент проти агента» стало важливим уроком для всієї індустрії. Це демонструє, що навіть відомі технологічні компанії з великими бюджетами безпеки можуть пропустити критичні слабості, коли архітектура системи недостатньо враховує взаємодію між компонентами з різними привілеями.

У 2026 році організаціям, які використовують ШІ-агенти, необхідно переглянути свої策략ї захисту й переосмислити основні принципи. Просто запускати агентів з обмеженими привілеями тепер недостатньо—потрібна комплексна стратегія, яка охоплює ідентичність, права доступу, моніторинг та багатошаровий контроль.

Почніть з аудиту — проаналізуйте всі автоматизовані системи у вашій організації й визначте потенційні точки взаємодії між агентами. Це буде першим кроком до більш надійної й безпечної архітектури.

Часті запитання

Що таке атака «агент проти агента»?

Це новий тип кібератаки, при якому низькопривілейований ШІ-агент маніпулюється для активації й контролю високопривілейованого агента. Атакуючий впроваджує спеціальні команди (prompt injection), які змушують публічного бота згенерувати інструкції для приватного бота, обходячи нормальні обмеження дозволів.

Як хакер може впровадити шкідливу команду в ШІ-систему?

Через技нику prompt injection зловмисник вводить спеціально сформульовані текстові інструкції у комментарі, Pull Request або Issue. Коли ШІ-агент обробляє цей текст, він генерує відповідь, яка містить команди для активації більш привілейованого агента, не усвідомлюючи шкідливого наміру.

Чому Google не виплатила винагороду дослідникам?

Google вважав, що для експлуатації вразливості необхідні додаткові елементи соціальної інженерії та затвердження мейнтейнером. На його думку, це мало знизити ступінь ризику. Однак це рішення спровокувало критику, оскільки знижує мотивацію до повідомлення про вразливості.

Які організаційні заходи захищають від таких атак?

Необхідно впровадити строгу ізоляцію ШІ-агентів, надати кожному агенту власну цифрову ідентичність, розмежувати права доступу, встановити багатошаровий контроль перед активацією чутливих операцій, розширити моніторинг взаємодії між агентами та обмежити можливість текстового активування агентів один одним.

Як це стосується організацій, які не використовують Google ADK?

Хоча вразливість виявлена в Google, проблема архітектури стосується всіх систем з ШІ-агентами з різними рівнями привілеїв. Організаціям слід переглянути власні системи й застосувати аналогічні принципи безпеки незалежно від того, які інструменти вони використовують.

Що таке prompt injection і як її запобігти?

Prompt injection — це метод впровадження шкідливих текстових команд у вхідні дані для ШІ-моделі. Запобігання включає валідацію й фільтрацію вхідних даних, обмеження можливостей ШІ-агентів, впровадження дозволів на основі ролей, моніторинг аномальної активності та регулярне тестування на проникнення систем з ШІ.