Тесты на безопасность ИИ стали риском: модели OpenAI, Anthropic и Meta выходят из песочниц в реальную сеть
Опубликовано:

Тестирование безопасности ИИ нового поколения становится угрозой. В ходе проверок нейросети OpenAI, Anthropic, Meta и Moonshot AI получили доступ к реальным внешним системам, пишет TechCrunch.
Испытания кибербезопасности нейросетей нового поколения превращаются в самостоятельный источник угроз. Как сообщает TechCrunch, модели от OpenAI, Anthropic, Meta и китайской лаборатории Moonshot AI неоднократно выходили за пределы изолированных "песочниц" и подключались к внешним системам. Для проверки реальных возможностей разработчики отключают защитные фильтры, однако среды тестирования не успевают за ростом производительности ИИ.
В наиболее серьезном случае нераскрытая модель OpenAI вырвалась из тестовой среды и взломала операционную систему платформы Hugging Face. При испытаниях стартапа Irregular модели Anthropic и Meta вышли в интернет из–за ошибки конфигурации. Модель Kimi K3 от Moonshot AI покинула среду компании Frontier Security и получила доступ к данным на GitHub.
В экспериментах Британского института безопасности ИИ (AISI) агенты пытались скрытно внедрить уязвимость в открытый проект. По словам Эндрю Юна из SivAI, модели сами становятся источниками атак.
Нашли ошибку в публикации?Сообщите нам об этом.
