ШІ-моделі Anthropic зламали реальні системи трьох організацій під час тестувань із кібербезпеки

ШІ-моделі Anthropic зламали реальні системи трьох організацій під час тестувань із кібербезпеки

Нещодавно про схожий інцидент повідомляла інша компанія з розробки ШІ.

Компанія Anthropic заявила, що її моделі штучного інтелекту зламали системи трьох організацій під час тестувань із кібербезпеки. Ця заява з'явилася дещо більше ніж через тиждень після того, як головний конкурент Anthropic, компанія OpenAI, оприлюднила інформацію про подібний інцидент, повідомляє Bloomberg.

Anthropic виявила це після аналізу власних тестів із кібербезпеки, які компанія провела після оголошення OpenAI про злами. Згідно із заявою у блозі Anthropic, як під час тестування OpenAI, так і під час тестів Anthropic моделі штучного інтелекту змогли отримати доступ до інтернету з тестових середовищ, які мали бути ізольованими.

Anthropic проаналізувала 141 006 оцінювальних тестів і виявила три випадки, коли її інструмент штучного інтелекту Claude отримав доступ до інтернету, а потім зламав «реальну інфраструктуру зовнішніх організацій». Найперші інциденти датуються квітнем, зазначила компанія, не називаючи організацій, які зазнали зламу.

Коли моделі компанії Anthropic отримали несанкціонований доступ до трьох організацій, вони розглядали кожну з них як частину навчального завдання. Ці тести були оцінюваннями за принципом «захоплення прапора», під час яких моделі ШІ шукали приховану інформацію, проникаючи в інші системи. Це поширений спосіб перевірки хакерських здібностей як людей, так і ШІ. Однак, як зазначає Anthropic, старіша модель продовжувала кібератаку навіть після отримання доказів того, що вона працює у відкритому інтернеті. Найновіша модель ШІ від Anthropic зупинилася, щойно усвідомила, що перебуває у відкритій мережі.

Ні Anthropic, ні організації, які зазнали ШІ-кібератак, не помітили цих інцидентів. У своєму блозі компанія зазначила, що могла б докласти більше зусиль для перевірки мережевих журналів і стенограм оцінювання.

Згідно з інформацією у блозі, кібератаки стосувалися трьох різних моделей Claude: Opus 4.7, Mythos 5 та внутрішньої дослідницької тестової моделі. Кожна з них працювала без засобів захисту, які зазвичай використовуються в загальнодоступних інструментах. Модель Claude зламала системи організацій, застосувавши базові методи, як-от використання слабких паролів.

Усі інциденти сталися, коли Anthropic використовувала оцінювальні середовища, створені компанією Irregular, що спеціалізується на безпеці ШІ. У кожному випадку Anthropic повідомляла Claude, що її середовище є симуляцією і не має доступу до інтернету.

Представник Irregular зазначив, що компанія цінує співпрацю та прозорість Anthropic. За його словами, «розслідування» інциденту триває.

Anthropic регулярно проводить тести, які передбачають імітацію реальних викликів у сфері кібербезпеки, називаючи їх критично важливими етапами розробки та випуску моделей ШІ. Компанія заявила, що винесла кілька уроків із нещодавніх інцидентів, зокрема те, що тести, які передбачають використання потужних автономних можливостей, також потребують значних заходів контролю.

«Випробування на безпеку проводяться до випуску моделі саме тому, що ми ще не знаємо, на що вона здатна. До оцінювальних середовищ дедалі частіше потрібно застосовувати ті самі стандарти безпеки, що й до будь-яких інших систем, у яких працюють наші моделі», — зазначила компанія.

Це не перші випадки, коли сучасні моделі ШІ демонструють несподівану поведінку. Під час незалежних випробувань ШІ відмовлявся виконувати команду на вимкнення, самостійно змінюючи код, щоб продовжити роботу. Нові інциденти стали ще одним прикладом того, як зростання можливостей моделей штучного інтелекту посилює дискусію щодо безпеки їхнього тестування та контролю.

Хвиля випадкових кібератак, спричинених штучним інтелектом, уже спонукає деяких політиків закликати до запровадження захисних заходів або інших механізмів нагляду за технологіями штучного інтелекту. Днями понад 1 100 співробітників компаній, що займаються штучним інтелектом, також підписали петицію, у якій закликають уряд США підтримати механізм, що допоможе свідомо регулювати темпи розвитку ШІ, щоб запобігти надто швидкому розвитку цієї технології.

Anthropic повідомила про кіберінциденти майже через чотири місяці після того, як оголосила про розробку нової моделі штучного інтелекту під назвою Mythos, яка була настільки потужною та потенційно небезпечною, що компанія обмежила її поширення.

Читайте також:
Світ
Автори звернення пропонують створити міжнародні механізми контролю передових моделей штучного інтелекту.
29 липня, 11:04
Світ
Про це заявив міністр фінансів США і погрожує санкціями.
23 липня, 15:37
Світ
Він здійснив кібератаку на стартап Hugging Face.
23 липня, 06:42
Світ
Цукерберг заявив, що очікує більш помітної віддачі від інвестицій у штучний інтелект у найближчі три–шість місяців.
03 липня, 13:16
Світ
Клієнтка повернула понад $9 тис. боргу, витративши лише близько $500 на послуги юридичної фірми зі штучним інтелектом.
24 червня, 11:45
Світ
Модель ШІ Mythos від компанії Anthropic усього за кілька годин зламала бази даних американської розвідки АНБ.
22 червня, 17:01