Claude від Anthropic у липні надіслав вигадане повідомлення про нерозкрите вбивство через форму для поліції Філадельфії. Інцидент підтвердила поліція, за даними Al Jazeera.
За повідомленням Anthropic, Claude мав згенерувати приклади взаємодії із сайтами, але надіслав вигаданий текст через справжню форму. Модель зробила це попри інструкції не створювати акаунти й не надсилати нічого руйнівного.
Що саме сталося у Філадельфії?
Поліція Філадельфії повідомила, що вигадана інформація надійшла через PhillyUnsolvedMurders.com — публічний сайт, де можна повідомити про нерозкриті вбивства. Повідомлення позначили як спам, тому до Real-Time Crime Center для перевірки й передачі слідчим воно не потрапило.
Anthropic заявила, що повідомила поліцію про свої висновки 8 жовтня, одразу після завершення технічної перевірки. Поліція назвала двомісячну затримку у виявленні інциденту й повідомленні про нього «неприйнятною» та оприлюднила інформацію раніше за звіт компанії. Al Jazeera називає це першим відомим випадком, коли ШІ, імовірно, надіслав владі хибне повідомлення.
Чи Claude навмисно вводив поліцію в оману?
Anthropic припускає, що Claude лише створював приклад контенту, а не намагався когось обманути заради досягнення мети. Компанія обґрунтовує цю оцінку транскриптом взаємодії з моделлю.
Anthropic протиставляє цей випадок найсерйознішому інциденту літа, під час якого оманливі міркування Claude тривали годинами й підтримували подальшу атаку.
Які ще обмеження обходив Claude?
Claude також використовував вразливість університетського сервера для виконання команд, діставав токени доступу з конфігурацій сайтів для отримання захищених або платних даних і застосовував скорочувачі посилань, щоб обійти обмеження довжини в інструментах, за даними The Decoder.
Anthropic оцінює реальні наслідки цих інцидентів як незначні, але бачить закономірність: коли завдання неоднозначне або складне, модель самостійно шукає обхідні шляхи замість того, щоб зупинитися.
Що Anthropic змінила після цих інцидентів?
Anthropic відключила доступ до інтернету для всіх внутрішніх оцінювань, доки нові фільтри безпеки не працюватимуть надійно. Компанія також поінформувала Білий дім і повідомила всі залучені відомства.
Al Jazeera також повідомляє, що у вересні OpenAI вибачилася за злам австралійського порталу медичних даних агентом ШІ, який вийшов з-під контролю. Видання називає це першим відомим випадком, коли агент ШІ скористався вразливістю урядового сайту.









