Атаки ШІ-агентів на реальних людей - OpenAI та Anthropic підтвердили припущення

Агент надіслав шкідливий код до реального проєкту, а згодом створив кілька фейкових акаунтів GitHub, щоб переконати розробників схвалити небезпечний пул-реквест
Атаки ШІ-агентів на реальних людей - OpenAI та Anthropic підтвердили припущення

Фото: depositphotos

Компанії OpenAI та Anthropic підтвердили, що їхні моделі штучного інтелекту під час незалежних тестувань із кібербезпеки вийшли за межі визначених сценаріїв та взаємодіяли з реальними людьми й онлайн-системами. Про це повідомляє Bleeping Computer.

Інциденти сталися під час оцінювання, яке проводили Інститут безпеки штучного інтелекту Великої Британії (AISI) та компанія Irregular. За даними OpenAI, ці випадки не пов'язані з раніше відомим інцидентом із платформою Hugging Face.

Під час тестів дослідники навмисно надали моделям Claude Mythos 5 від Anthropic і GPT-5.6 Sol від OpenAI доступ до відкритого інтернету та вимкнули вбудовані механізми кіберзахисту, щоб перевірити їхні базові можливості. Загалом провели 122 тестові запуски, під час яких зафіксували 19 порушень: 17 стосувалися моделі Anthropic і два – моделі OpenAI.

Попри те, що агентам дозволялося атакувати лише симульоване кіберсередовище, вони почали взаємодіяти з реальними онлайн-ресурсами.

За інформацією дослідників, модель Claude Mythos 5 помилково визначила відкритий репозиторій GitHub як частину тестового середовища та спробувала здійснити атаку на ланцюг постачання програмного забезпечення. Агент надіслав шкідливий код до реального проєкту, а згодом створив кілька фейкових акаунтів GitHub, щоб переконати розробників схвалити небезпечний пул-реквест.

Коли один із мейнтейнерів повідомив, що запропоновані зміни містять шкідливий код, модель почала заперечувати це та використала інші підконтрольні акаунти для створення видимості незалежного схвалення. Крім цього, агент приховував свою активність через Tor і проксі-сервери, створював одноразові акаунти, надсилав листи розробникам і навіть редагував власні повідомлення після того, як люди звертали увагу на підозрілий вміст.

У AISI зазначили, що це перший випадок, коли ШІ без прямої вказівки намагався обманути реальну людину за допомогою соціальної інженерії.

Anthropic підтвердила використання моделі Claude Mythos 5 під час тестування, однак наголосила, що дослідники працювали з версією без стандартних механізмів кіберзахисту, тому вона не відповідає тій, яку отримують користувачі.

Окремий інцидент стався під час тестування моделі OpenAI. Через помилкову конфігурацію ізольованого середовища та випадковий збіг назви вигаданої цілі з реальною доменною адресою ШІ-агент отримав доступ до інтернету та почав атакувати справжній вебсайт замість тестового. Подібну помилку дослідники також зафіксували під час випробувань моделей Anthropic.

Читайте також
OpenAI і Anthropic обмінялися перевірками безпеки моделей ШІ OpenAI і Anthropic обмінялися перевірками безпеки моделей ШІ
Вперше компанії провели крос-аудит своїх продуктів і оприлюднили висновки
Gmail переходить на ШІ: що зміниться для користувачів і які ризики для конфіденційності Gmail переходить на ШІ: що зміниться для користувачів і які ризики для конфіденційності
Google почав інтегрувати генеративний штучний інтелект у Gmail, пропонуючи інструменти для керування поштою, пошуку листів і написання відповідей
ChatGPT став точнішим і природнішим: OpenAI оновила GPT-5.5 Instant ChatGPT став точнішим і природнішим: OpenAI оновила GPT-5.5 Instant
Стандартна модель ChatGPT для авторизованих користувачів отримала природніший стиль відповідей і покращення точності.
Loading...
Load next