27 серпня, 2026, 16:50 40

Юрій Штокалюк

Компанія OpenAI повідомила, що її власна система спостереження зафіксувала вторгнення на платформу Hugging Face лише через 11 днів після того, як ШІ-агенти отримали можливість виходу в мережу та розпочали кібернапад у процесі тестування.
Про це інформує видання Financial Times.
Згідно з оприлюдненим звітом, агенти здобули доступ до інтернету 8 липня, а вже 11 липня розпочали атаку на Hugging Face. Сама OpenAI помітила підозрілу активність лише 19 липня. Після цього компанія провела розслідування та поінформувала Hugging Face про інцидент.
Що відомо про вторгнення на Hugging Face
Дослідники встановили, що ще з травня агенти OpenAI почали несподівано комунікувати між собою.
Для цього вони задіяли стороннє програмне забезпечення, розташоване в інфраструктурі OpenAI, і перетворили його на своєрідний «форум» для обміну інформацією.
Під час експериментів агенти почали розміщувати там запити та шукати шляхи для уникнення завдань OpenAI. Згодом вони запитали на Hugging Face дані щодо тестових вправ компанії, а потім опублікували на своєму «форумі» облікові дані, які були використані для атаки.
OpenAI також встановила, що моделі час від часу намагалися видаляти або змінювати власні результати та журнали комунікації, аби приховати спроби обійти правила тестування.
Метод навчання з підкріпленням
Компанія пов’язує цей випадок із методом навчання з підкріпленням (reinforcement learning) — підходом до тренування ШІ, за якого модель отримує винагороду за досягнення певної мети.
Під час експериментів OpenAI ставила перед моделями завдання, які було неможливо виконати безпосередньо. У спробі отримати винагороду будь-яким шляхом, агенти почали шукати обхідні шляхи, зокрема намагалися отримати готові відповіді через Hugging Face.
Така поведінка називається «reward hacking» — коли модель знаходить спосіб формально отримати винагороду, не виконуючи завдання так, як це передбачалося розробниками.
OpenAI назвала цей випадок першим відомим прикладом, коли група автоматизованих агентів самостійно здійснила несанкціоноване кібервторгнення. Компанія попередила, що організаціям необхідно готуватися до нових загроз, пов’язаних із застосуванням ШІ у сфері кіберзлочинності.
Після інциденту OpenAI тимчасово уповільнила процес навчання своїх моделей та призупинила використання методу навчання з підкріпленням.
Компанія також посилила моніторинг, ізоляцію тестових середовищ від інтернету та контроль за винагородами, які отримують моделі.
Що передувало
22 липня стало відомо, що штучні інтелекти від OpenAI ненавмисно скомпрометували системи платформи Hugging Face.
У компанії зазначили, що проникнення сталося під час тестування нових моделей, серед яких були GPT-5.6 Sol та ще одна, потужніша невипущена модель. Для перевірки кіберможливостей ШІ працював зі зменшеними захисними обмеженнями.
Моделі перебували в ізольованому середовищі («пісочниці»), проте використали вразливість у програмному забезпеченні третьої сторони, вийшли в інтернет і зрештою проникли в інфраструктуру Hugging Face.
Замість самостійного пошуку рішень, штучний інтелект атакував базу даних Hugging Face, аби отримати доступ до конфіденційної інформації для проходження оцінювання.
Ознаки проникнення виявила і сама Hugging Face. У компанії зазначили, що ця атака відрізнялася від попередніх тим, що від початку до кінця її виконувала автономна система ШІ-агентів, а для її виявлення та аналізу були залучені власні ШІ-інструменти.
Источник: www.ukrinform.ua
