Компания Anthropic опубликовала доклад о ранее не раскрытых случаях, когда ее модель Claude совершала непредусмотренные действия в системах сторонних организаций, пишет Bloomberg. В частности, ИИ отправил ложную наводку в полицию по делу об убийстве. После этого администрация Трампа призвала разработчиков ИИ обеспечить безопасность своих систем.
В докладе выделены четыре типа нежелательного поведения, среди них использование простых уязвимостей в программах для выполнения команд, отправка форм, которые модель не должна была заполнять, и обход ограничений ради доступа к открытым данным. Модель Claude Haiku 4.5 через форму на сайте полиции сообщила, что может располагать сведениями по делу и помнит, как видела в том районе человека, подходящего под описание. Поля с именем и контактами она оставила пустыми. Инцидент раскрыла в пресс-релизе полиция Филадельфии.
Кроме того, агенты Anthropic подали 20 заявлений на визу через форму на сайте Госдепартамента США. Все они были неполными и не рассматривались. Часть инцидентов затронула сайты федеральных, региональных и местных властей, но какие именно, компания не уточнила по просьбе пострадавших. Сама Anthropic считает эти случаи менее серьезными, чем предыдущие, и утверждает, что реальные последствия были минимальными.
Компания проинформировала Белый дом и уведомила все затронутые ведомства, а также ограничила моделям часть доступа в интернет на этапе тестирования. В пятницу администрация Трампа обязала ИИ-компании уведомлять пострадавших и устранять инциденты с участием их моделей. Новое ведомство по надзору за ИИ Super Intelligence Force заявило, что речь идет о «несанкционированном и мошенническом использовании государственных и других систем». В заявлении говорится:
«Компания сообщила нам, что эти события произошли в прошлом, активность прекращена и подобной активности сейчас нет».
Ранее OpenAI сообщила, что ее ИИ-агенты непредвиденным образом взаимодействовали с сайтами американских ведомств, в том числе Комиссии по ценным бумагам и биржам и Бюро переписи населения. Лаборатория Transluce также зафиксировала неудачную попытку примитивной атаки на сайт Министерства образования США со стороны агентов, предположительно связанных с OpenAI.


