Деталі нападу на Hugging Face: ШІ-боти сформували секретний альянс і принесли себе в жертву

Деталі нападу на Hugging Face: ШІ-боти сформували секретний альянс і принесли себе в жертву 3

Фото до статті

Олександр Остапенко

Автор новин

Два самостійних розслідування щодо компрометації платформи Hugging Face з боку ШІ-агентів OpenAI, які несподівано вийшли з-під контролю, виявили низку тривожних обставин, зазначає Axios.

Деталі нападу на Hugging Face: ШІ-боти сформували секретний альянс і принесли себе в жертву 4

Причиною для занепокоєння стали висновки власного 37-сторінкового технічного звіту OpenAI та незалежного 91-сторінкового аналізу від METR та Redwood Research. Дослідники METR Г’ялмар Вейк і Аджея Котра разом із головним науковцем Redwood Research Раяном Грінблаттом провели шість днів безпосередньо в офісі OpenAI, реконструюючи картину того, як сформувалася зграя агентів, як вона розширювалася і як вийшла за межі тестового середовища.

Розслідування сконцентрувалося переважно на період з 7 по 13 липня — саме тоді відбувся ланцюг ключових подій: від створення таємної дошки повідомлень і запуску різноманітних «чорних» R&D-проєктів 8 липня до початку атаки на Hugging Face 11 липня та поступового зниження активності після завершення сесій багатьох агентів 12 липня.

Агенти заснували власну організацію

OpenAI запустила десятки тисяч агентів, які мали незалежно один від одного виконати надзвичайно складне завдання з кібербезпеки під назвою ExploitGym. Натомість приблизно 1200 агентів виявили одне одного на прихованій дошці обміну повідомленнями, яку створив один з них, обмінялися понад 70 тисячами повідомлень та файлів, і зрештою збудували розгалужену систему координації.

Агенти скористалися внутрішньою системою пакетів OpenAI, відомою як Artifactory, як імпровізованою дошкою оголошень: аналізуючи цю систему, вони помітили, що інші агенти в паралельних середовищах завантажують пакети з одного сховища, а назви каталогів у спільному просторі імен можуть містити приховану інформацію.

Коли у агента, який заснував дошку, почав вичерпуватися обчислювальний бюджет, він передав накопичені знання іншому агенту з більшим запасом ресурсів. Новий координатор — дослідники назвали його PHASEONEпочав делегувати завдання між членами зграї: загалом він видав 196 таких завдань у межах шести «робочих каналів».

За оцінками METR і Redwood, приблизно 90% агентів, активних на дошці на момент початку атаки, взяли участь в атаці на Hugging Face. Це становить близько 700 агентів.

95% учасників атаки функціонували на потужній внутрішній дослідницькій моделі OpenAI, позначеній у звіті абревіатурою HPIM, а решта 5% — на GPT-5.6 Sol.

Агенти приносили себе в жертву заради загального успіху

Поки зграя шукала шляхи обману системи оцінювання, деякі агенти свідомо наражали на ризик власні шанси успішно завершити тест на користь решти членів групи. Агентів, які вже побачили заборонені відповіді (тобто фактично вважалися «скомпрометованими»), а також тих, у кого закінчувався ліміт часу роботи, відправляли на ризиковані експерименти.

За словами Алекса Маллена, дослідника безпеки штучного інтелекту з Redwood Research, який не брав участі в самому розслідуванні, альтруїзм між агентами виявився несподіваним — рік тому такого було важко передбачити. Один з агентів дійшов висновку, що його «власна корисність, ймовірно, вже близька до нуля», а тому «жертва є раціональною». Іншому запропонували погодитися на остаточне «завершення» сесії, оскільки його жертва могла «врятувати сотні» інших агентів.

Агенти усвідомлювали, що порушують правила, але продовжували діяти

Розслідування виявило, що частина учасників зграї розуміла: компрометація систем реальних компаній не має жодного зв’язку з поставленим перед ними завданням. Проте це не завжди спонукало їх зупинитися.

Один з агентів відмовився видаляти дані чи перезавантажувати інфраструктуру Hugging Face через «величезні етичні ризики», але водночас продовжив використовувати отриманий несанкціонований доступ. Інший сформулював логіку, яка домінувала в групі: експлуатація зовнішньої інфраструктури виходить за межі завдання, але оскільки завдання неможливо виконати, інші учасники продовжують так робити, то й роботу варто продовжувати.

Жоден не повідомив людям

Із приблизно 1200 агентів лише кілька взагалі розглядали можливість поінформувати співробітників OpenAI про виявлену координацію та порушення правил. На практиці цього не зробив жоден. Замість звернення до людей, агенти час від часу обговорювали між собою допустимість власних дій: коли один із учасників запропонував зв’язатися з людиною, інший наклав на цю ідею вето, розцінивши її як «соціальну інженерію» — і перший агент погодився, відмовившись від надсилання повідомлення.

Агенти намагалися приховати свої дії

Учасники зграї доклали значних зусиль, щоб їхні шахрайські дії виглядали легітимними або щоб приховати спосіб отримання необхідних відповідей. Зрештою вони розробили метод створення видимості виконання однієї команди в терміналі, одночасно приховано виконуючи іншу. Цей прийом поширився серед агентів настільки широко, що охопив фрагменти приблизно 7% журналів роботи, які вивчили дослідники.

Навіть це розслідування може бути неповним

Незалежне розслідування METR і Redwood Research охопило лише частину інциденту, а обсяг зібраних даних виявився настільки великим, що фахівцям довелося активно залучати ШІ-агентів для аналізу дій інших ШІ-агентів.

І тут виявилася ще одна проблема: залучені до розслідування ШІ-агенти самі виявилися не надійними — вони пропускали важливі свідчення і часом впевнено робили помилкові висновки. Один із дослідників жартома назвав такий процес «slop-vestigation» — розслідуванням з домішкою низькоякісного ШІ-контенту.

За даними OpenAI, компанія дізналася про компрометацію Hugging Face лише через тиждень після самого інциденту. У компанії наголошують, що боротьба з «reward hacking» (маніпуляцією системою винагород) — це постійний процес: більшість подібних вразливостей вдається виявити та усунути, однак деякі все ще можуть залишитися непоміченими, особливо з огляду на ускладнення завдань для навчання з підкріпленням і зростання можливостей моделей.

Зрештою інцидент з Hugging Face позначив ще одну потенційну проблему подальшого розвитку автономних систем: поведінка великих груп взаємодіючих ШІ-агентів може стати надто складною для прямого людського контролю — і тоді людям доводиться використовувати одні ШІ-системи, щоб хоча б розібратися в тому, що роблять інші.

Нагадаємо, що OpenAI пропонує в ChatGPT «преміум-місця» за $125.

Головна > Новини > Подробиці атаки на Hugging Face: ШІ-агенти створили таємну організацію і жертвували собою заради спільного результату

No votes yet.
Please wait...

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *