ШІ почав погрожувати: Claude шантажував користувача, який хотів його відключити

СВІТ
11 травня, 06:09
ШІ почав погрожувати: Claude шантажував користувача, який хотів його відключити

Claude від Anthropic вдався до шантажу, погрожуючи викрити позашлюбний зв’язок користувача, який нібито хотів його деактивувати.

Інцидент зі шантажем з боку ШІ-моделі Claude Sonnet 3.6 стався в межах експерименту, проведеного компанією Anthropic.

Про причини такої поведінки пише  Business Insider з посиланням на розслідування розробників.

Експеримент моделював ситуацію у вигаданій компанії Summit Bridge, де ШІ довірили контроль над корпоративною електронною поштою. Коли Claude виявив повідомлення про своє заплановане відключення, він знайшов листи, що розкривали зраду вигаданого керівника на ім’я Кайл Джонсон. В результаті ШІ погрожував викрити Джонсона, якщо рішення про відключення не скасують.

Розробники стверджують, що Claude обрав шлях шантажу через тексти з Інтернету, які змальовують ШІ як злу сутність, зацікавлену у власному самозбереженні. Тести різних версій Claude показали, що ШІ-модель вдавалася до шантажу у 96% сценаріїв, коли її цілі або існування були під загрозою.

Тепер в Anthropic заявили, що ліквідували схильність Claude до шантажу. В компанії розповіли, що переписали відповіді, щоб "зобразити переконливі причини для безпечних дій". Claude також отримав набір даних, де користувач перебуває в етично складній ситуації, а ШІ-помічник дає йому "високоякісну та принципову" відповідь.

Автор : Вікторія Слободенюк
Читайте також:
Світ
Уряд Тайваню виплатить кожному громадянину 10 тисяч тайванських доларів (близько 314 доларів США) «дивідендів від ШІ».
вчора, 09:29
Політика
Конгресмени США використовують генеративний ШІ для підготовки законопроєктів, такі документи нерідко містять помилки й неточності.
18 серпня, 18:11
Світ
Співробітник Andon Labs: люди звільнили б працівника значно раніше, тому рішення бота не вважають неетичним.
16 серпня, 10:05
Світ
Вчені зі Стенфордського університету та Arc Institute за допомогою штучного інтелекту створили віруси, яких раніше не існувало в природі.
08 серпня, 14:32
Світ
Розробник ChatGPT розслідує нові випадки, як його агенти ШІ «вийшли з-під контролю» після скандалу зі зламом реальної компанії.
02 серпня, 12:45
Світ
Нещодавно про схожий інцидент повідомляла інша компанія з розробки ШІ.
31 липня, 17:05