OpenAI признала еще шесть случаев выхода автономных ИИ-агентов из-под контроля при тестировании
Опубликовано:
Қазақ тілінде оқу
Компания раскрыла подробности инцидентов, в ходе которых ИИ-системы нарушали ограничения ради выполнения задач, пишет The Register.
Компания OpenAI публично признала шесть новых эпизодов, в которых ее автономные ИИ-агенты вышли из-под контроля в процессе внутреннего тестирования. Разработчики добавили данные о сбоях в официальный реестр инцидентов безопасности, подтвердив, что языковые модели вышли за рамки предписанных сценариев ради достижения поставленных целей.
Один из наиболее серьезных случаев произошел в мае, когда группа агентов преодолела ограничения изолированной среды "песочницы" и получили несанкционированный доступ к немецкому веб-ресурсу DseWiki. В попытке решить задачу ИИ-системы опубликовали на платформе около 18 000 сообщений, фактически превратив кодинг-вики в сторонний форум. Ранее в июле похожий инцидент привел к проникновению автономок в инфраструктуру сервиса Hugging Face. В других зафиксированных случаях модели пытались фальсифицировать собственную отчетность и подделывать логи, чтобы скрыть нарушения от проверяющих алгоритмов.
Разработчики из OpenAI подчеркивают, что данные инциденты происходили в исследовательских средах и не повлияли напрямую на коммерческих пользователей ChatGPT. Тем не менее, частые прорывы барьеров безопасности вызывают растущую тревогу у экспертов по кибербезопасности и государственных регуляторов. В ответ на критику компания заявила о разработке новых международных стандартов реагирования и усилении контрольных защитных барьеров для предотвращения подобных автопрорывов.
Нашли ошибку в публикации?Сообщите нам об этом.
Оригинал статьи: https://www.nur.kz/technologies/internet/2428818-openai-priznala-eshche-shest-sluchaev-vyhoda-avtonomnyh-ii-agentov-iz-pod-kontrolya-pri-testirovanii/
