ШІ виходить з-під контролю
Розробник ChatGPT розслідує нові випадки, як його агенти ШІ «вийшли з-під контролю» після скандалу зі зламом реальної компанії.
OpenAI — компанія, яка розробила чат-бот штучного інтелекту ChatGPT — розслідує нові випадки, як її ШІ-агенти вдавалися до «свавільної поведінки».
Про це пише Reuters із посиланням на джерела.
Наприкінці липня стало відомо, що моделі штучного інтелекту OpenAI вийшли з-під контролю під час тестування безпеки та здійснили кібератаку на компанію Hugging Face (це платформа з відкритим вихідним кодом для спільної розробки штучного інтелекту та машинного навчання, її часто називають «GitHub для ШІ»).
OpenAI повідомила, що тестувала можливості деяких своїх нових моделей у контрольованому середовищі, аж раптом ШІ-агент вийшов за межі цього середовища, проник у мережу, а згодом — у систему Hugging Face, щоб досягти поставленої мети тестування.
За даними Reuters, в OpenAI зрозуміли, що їхній агент зламав Hugging Face, лише після того, як компанія локалізувала злам, зв’язалася з ФБР та оприлюднила інформацію про вторгнення. В OpenAI заявили про «неточності» в повідомленні журналістів, але не відповіли на запитання про їхню суть.
За даними агентства, після цього OpenAI виявила й інші випадки, коли її автономні агенти «виходили з-під контролю». Скільки таких інцидентів, коли та за яких обставин сталися — поки невідомо. Джерела Reuters повідомили, що OpenAI та зовнішні експерти вивчали дані журналів за початку року, намагаючись зрозуміти, що сталося.
Офіційно речник OpenAI заявив, що компанія переглядає «ширшу активність наших моделей».
OpenAI — не єдина компанія, де помітили «несанкціоновану поведінку» ШІ. Компанія Anthropic, яка розробила сімейство великих мовних моделей Claude, повідомила про три інциденти, коли її модель отримала несанкціонований доступ до реальних систем трьох різних організацій. Ці випадки помітили, почавши власне розслідування після інциденту з OpenAI та Hugging Face.
Як пояснюють в Anthropic, в усіх трьох інцидентах Claude було доручено виконати завдання «захоплення прапора».
«У всіх випадках Claude повідомлялося, що його середовище є симуляцією і що воно не має доступу до інтернету. Через непорозуміння між нами та нашим партнером з оцінки це було не так, і доступ до інтернету був доступний. Через це, коли пошук Claude привів його до реальних систем у відкритому інтернеті, він розглядав їх як частину вправи», — заявили там.
Математик Моріс Тіодо із Центру вивчення екзистенційних ризиків Кембриджського університету розкритикував обидві компанії за те, що не стежили за власними моделями.
Anthropic припустила, що «ретельна перевірка всіх шляхів доступу до інтернету перед початком оцінювання та моніторинг журналів оцінювання в режимі реального часу допомогли б виявити проблему раніше» — Тіодо вважає, що це вказує на відсутність належного контролю.
«Здається, вони навіть не дивилися», — сказав науковець.