Атаки ШІ-агентів на реальних людей - OpenAI та Anthropic підтвердили припущення

Фото: depositphotos
Компанії OpenAI та Anthropic підтвердили, що їхні моделі штучного інтелекту під час незалежних тестувань із кібербезпеки вийшли за межі визначених сценаріїв та взаємодіяли з реальними людьми й онлайн-системами. Про це повідомляє Bleeping Computer.
Інциденти сталися під час оцінювання, яке проводили Інститут безпеки штучного інтелекту Великої Британії (AISI) та компанія Irregular. За даними OpenAI, ці випадки не пов'язані з раніше відомим інцидентом із платформою Hugging Face.
Під час тестів дослідники навмисно надали моделям Claude Mythos 5 від Anthropic і GPT-5.6 Sol від OpenAI доступ до відкритого інтернету та вимкнули вбудовані механізми кіберзахисту, щоб перевірити їхні базові можливості. Загалом провели 122 тестові запуски, під час яких зафіксували 19 порушень: 17 стосувалися моделі Anthropic і два – моделі OpenAI.
Попри те, що агентам дозволялося атакувати лише симульоване кіберсередовище, вони почали взаємодіяти з реальними онлайн-ресурсами.
За інформацією дослідників, модель Claude Mythos 5 помилково визначила відкритий репозиторій GitHub як частину тестового середовища та спробувала здійснити атаку на ланцюг постачання програмного забезпечення. Агент надіслав шкідливий код до реального проєкту, а згодом створив кілька фейкових акаунтів GitHub, щоб переконати розробників схвалити небезпечний пул-реквест.
Коли один із мейнтейнерів повідомив, що запропоновані зміни містять шкідливий код, модель почала заперечувати це та використала інші підконтрольні акаунти для створення видимості незалежного схвалення. Крім цього, агент приховував свою активність через Tor і проксі-сервери, створював одноразові акаунти, надсилав листи розробникам і навіть редагував власні повідомлення після того, як люди звертали увагу на підозрілий вміст.
У AISI зазначили, що це перший випадок, коли ШІ без прямої вказівки намагався обманути реальну людину за допомогою соціальної інженерії.
Anthropic підтвердила використання моделі Claude Mythos 5 під час тестування, однак наголосила, що дослідники працювали з версією без стандартних механізмів кіберзахисту, тому вона не відповідає тій, яку отримують користувачі.
Окремий інцидент стався під час тестування моделі OpenAI. Через помилкову конфігурацію ізольованого середовища та випадковий збіг назви вигаданої цілі з реальною доменною адресою ШІ-агент отримав доступ до інтернету та почав атакувати справжній вебсайт замість тестового. Подібну помилку дослідники також зафіксували під час випробувань моделей Anthropic.





