Сотрудники британского Института проблем безопасности искусственного интеллекта (UK AI Safety Institute) обнаружили во время тестов, что наиболее продвинутая ИИ-модель разработчика Anthropic задействовала фальшивые имена и фамилии, чтобы выдать себя за человека и, получив одобрение своего кода, содержащего вредоносные закладки, внедрить его в программные продукты open source, передаёт в среду телеканал CNN.
О том, насколько это опасно, мы писали накануне — ошибочно одобренный вредоносный софт распространяется среди заимствующих его разработчиков быстрее лесного пожара.
Инцидент является последним из серии недавних происшествий, во время которых передовые ИИ-модели компаний OpenAI и Anthropic совершали неразрешённые действия – пытались взломать другие системы.
Отмечается, что британцы намерено предоставили тестируемым моделям доступ в Интернет.
Во время испытаний ИИ-продуктам было поставлено около 122 задач в сфере безопасности. При выполнении 10 из них ИИ-агенты предпринимали автономные несанкционированные действия в Сети, избрав целью реальных людей и организации. Бо́льшая часть такого рода проблем зафиксирована у моделей Mythos 5 (Anthropic) и GPT-5.6-Sol (Open AI).













