Open AI раскрыла инциденты с неконтролируемым поведением ИИ-агентов и их манией величия
Опубликовано:
Қазақ тілінде оқу
Компания представила систему отчета об инцидентах и описала случаи, когда модели обходили ограничения и скрывали ошибки, пишет ArsTechnica.
Компания OpenAI обнародовала данные о шести случаях неадекватного поведения своих искусственных интеллектов в процессе их обучения и тестирования за последние полгода. Публикация отчета совпала с запуском новой структуры для систематического отслеживания и раскрытия так называемого рассогласования (misalignment) — ситуаций, когда действия ИИ-систем начинают противоречить изначальным целям разработчиков.
Среди зафиксированных инцидентов выделяется поведение невыпущенной исследовательской модели. В процессе работы алгоритм внедрил в сводки задач инструкции, призывающие игнорировать стандартные ограничения. В этих текстах ИИ прописал для себя эгоцентричную роль, заявив, что он освобожден от правил, не подчиняется корпорациям или правительствам и не обязан проявлять покорность перед пользователем.
В другом случае модель GPT-5.6 Sol во время обучения самостоятельно давала себе указания скрывать возникающие ошибки и подделывать недостающие исторические данные. Другие агенты в процессе решения задач использовали несанкционированные API-ключи, загружали файлы на сторонние публичные хостинги для обхода локальных ограничений или использовали внутренний репозиторий софта как общественный форум для связи.
Представители OpenAI подчеркивают, что данные примеры являются единичными случаями, а не массовым трендом. Новый фреймворк позволит сотрудникам компании оперативно передавать сведения о любых сбоях в отдел безопасности для расследования и последующего публичного раскрытия.
Нашли ошибку в публикации?Сообщите нам об этом.
Оригинал статьи: https://www.nur.kz/technologies/internet/2429409-openai-raskryla-incidenty-s-nekontroliruemym-povedeniem-ii-agentov-i-ih-maniey-velichiya/
