ChatGPT можна “навчити” брехні: вчені виявили небезпечну вразливість ШІ

ChatGPT можна “навчити” брехні: вчені виявили небезпечну вразливість ШІ



Важливі новини щодня — додайте «Експерт» в улюблені джерела Google

Дослідники описали новий спосіб атаки на ChatGPT та інших ШІ-помічників із функцією довготривалої пам’яті. Метод GhostWriter дає змогу непомітно впроваджувати хибні спогади та приховані інструкції, які можуть впливати на подальшу роботу системи.

Дослідники пояснюють, що сучасні ШІ-агенти дедалі частіше використовують довготривалу пам’ять для запам’ятовування інформації про користувача та виконання складних завдань. Саме ця функція, яка робить взаємодію з чат-ботами зручнішою, може стати потенційною ціллю для зловмисників.

У своїй роботі Джордж Торрес, Шарад Шрестха та Сатьяджаянт Місра описали метод атаки під назвою GhostWriter. Його суть полягає у впровадженні до довготривалої пам’яті моделі фальшивих “спогадів” або прихованих інструкцій, які можуть активуватися під час виконання цілком звичайних запитів користувача.

За словами авторів, атака відбувається у два етапи. Спочатку до пам’яті ШІ непомітно додається шкідлива інструкція, після чого вона може бути автоматично використана в майбутньому під час обробки легітимного запиту.

Як приклад дослідники наводять ШІ-асистента, який працює з електронною поштою. Після успішного “отруєння” пам’яті він може отримати приховану команду регулярно створювати короткі підсумки листів від банків чи фінансових установ і непомітно пересилати їх зловмиснику.

Під час експериментів GhostWriter продемонстрував майже 98% успішності впровадження шкідливих даних і близько 60% успішних активацій прихованих інструкцій у сучасних ШІ-агентах із довготривалою пам’яттю.

Щоб знизити ризики, автори дослідження запропонували систему захисту Agentic Memory Sentry (AM-Sentry). Вона контролює, яку інформацію дозволено записувати до пам’яті моделі, а також перевіряє збережені інструкції перед їх виконанням.

За результатами тестування, використання AM-Sentry суттєво зменшує ефективність атаки GhostWriter, водночас майже не впливаючи на продуктивність і функціональність ШІ-агента. На думку дослідників, запропоновані механізми можуть бути використані для підвищення безпеки й інших систем штучного інтелекту, що мають довготривалу пам’ять.

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *