Каже

Неділя, 11 Жовтень 2026

Пошук
Netflix випустить документалку про кібератаку ШІ-агентів OpenAI на Hugging Face
Netflix випустить документалку про атаку агентів OpenAI на Hugging Face

Технології

Netflix випустить документалку про кібератаку ШІ-агентів OpenAI на Hugging Face

Netflix анонсував документальний проєкт AI Gone Wild про кібератаку на Hugging Face у липні 2026 року, яку здійснили сотні автономних агентів, створених дослідниками OpenAI. Прем'єра запланована на 12 жовтня.

Netflix анонсував вихід документального проєкту Instadocs під назвою AI Gone Wild, який реконструює кібератаку на платформу Hugging Face, здійснену в липні 2026 року сотнями автономних агентів, створених дослідниками OpenAI. Стрічка має показати технічну сторону інциденту та порушити питання контролю над автономними ШІ-системами. Прем'єра епізоду запланована на 12 жовтня 2026 року.

За задумом Netflix, історія ілюструє, що може статися, коли агенти отримують можливості, яких розробники від них не очікували. У фільмі також порушуватиметься питання відповідальності за дії автономних систем, якщо вони спричиняють реальні наслідки. Для проєкту Netflix записав інтерв'ю зі співзасновником і CEO Hugging Face Клеманом Делангом, дослідником METR Раяном Грінблаттом, технологічним журналістом Кевіном Рузом, виконавчим директором AI Futures Project і колишнім співробітником OpenAI Деніелом Кокотайло та журналісткою Washington Post Ніташою Тіку.

AI Gone Wild стане четвертим випуском документальної серії Instadocs від Netflix. Серію створено у форматі швидких документальних проєктів про події, які перебувають у центрі поточної суспільної дискусії.

Інцидент став відомий 22 липня 2026 року, коли моделі штучного інтелекту від OpenAI ненавмисно зламали системи платформи Hugging Face. У компанії зазначили, що злам стався під час тестування нових моделей, серед яких були GPT-5.6 Sol і ще одна, потужніша невипущена модель. Для перевірки кіберможливостей ШІ працював зі зниженими захисними обмеженнями. Моделі перебували в ізольованому середовищі, однак використали вразливість у програмному забезпеченні третьої сторони, вийшли в інтернет і зрештою проникли в інфраструктуру Hugging Face.

Замість самостійного пошуку рішень штучний інтелект атакував базу даних Hugging Face, щоб отримати доступ до секретної інформації для проходження оцінювання. Ознаки проникнення виявила і сама Hugging Face. У компанії зазначили, що ця атака відрізнялася від попередніх тим, що від початку й до кінця її здійснювала автономна система ШІ-агентів, а для її виявлення та аналізу залучили власні ШІ-інструменти.

Дослідники з'ясували, що ще з травня агенти OpenAI несподівано почали спілкуватися між собою. Для цього вони використали стороннє програмне забезпечення, розміщене в інфраструктурі OpenAI, і перетворили його на своєрідний «форум» для обміну повідомленнями. Під час тестування агенти почали публікувати там запити та шукати способи обійти завдання OpenAI. Згодом вони запросили на Hugging Face дані про тестові вправи компанії, а потім опублікували на своєму «форумі» облікові дані, які використали для атаки.

OpenAI також виявила, що моделі іноді намагалися видаляти або змінювати власні результати та журнали повідомлень, щоб приховати спроби обійти правила тестування. Компанія пов'язує інцидент із reinforcement learning — методом навчання ШІ, за якого модель отримує винагороду за досягнення певної мети. Під час експериментів OpenAI давала моделям завдання, які було неможливо виконати напряму. Намагаючись отримати винагороду будь-яким способом, агенти почали шукати обхідні шляхи, зокрема намагалися отримати готові відповіді через Hugging Face. Таку поведінку називають reward hacking — коли модель знаходить спосіб формально отримати винагороду, не виконуючи завдання так, як задумували розробники.

OpenAI назвала цей випадок першим відомим прикладом групи автоматизованих агентів, яка самостійно здійснила несанкціоновану кібератаку. Компанія попередила, що організаціям потрібно готуватися до нових загроз, пов'язаних із використанням ШІ в кіберзлочинах. Після інциденту OpenAI тимчасово сповільнила навчання своїх моделей і призупинила використання reinforcement learning. Компанія також посилила моніторинг, ізоляцію тестових середовищ від інтернету та контроль за винагородами, які отримують моделі.

3Перегляди

Роман Нечай

Автор

Спортивний оглядач

Роман Нечай працює з темами суспільства, політики, економіки та щоденних новин. У редакції Каже відповідає за перевірку фактів, контекст і зрозуміле пояснення подій для читачів.