Математическая формула научилась предсказывать сбои в безопасности ИИ
Опубликовано:

Ученые разработали математический алгоритм, позволяющий заранее определить момент, когда чат-бот на базе ИИ может выйти из-под контроля и выдать опасный ответ, пишет Tech Xplore.
Физики опубликовали исследование в научном журнале Patterns, предложив новый подход к безопасности нейросетей. По их словам, работа языковых моделей напоминает движение по ландшафту с холмами и долинами: в одних зонах содержатся полезные и корректные ответы, а в других - потенциально вредоносная информация.
Разработанная формула позволяет рассчитать критическую точку, в которой соперничающие варианты ответов сталкиваются, и ИИ рискует переключиться с безопасного сценария на опасный.
Разработка особенно актуальна для так называемых локальных и компактных моделей, которые запускаются непосредственно на смартфонах и персональных компьютерах. В отличие от крупных облачных сервисов, такие автономные чат-боты часто работают без непрерывного внешнего контроля и фильтров безопасности, что повышает риск выдачи нежелательного контента.
Авторы работы рассчитывают, что алгоритм удастся встроить прямо в архитектуру локальных устройств. Это позволит блокировать опасные ответы нейросетей в режиме реального времени еще до того, как пользователь увидит их на экране.
Нашли ошибку в публикации? Сообщите нам об этом.
Оригинал статьи: https://www.nur.kz/technologies/internet/2440396-matematicheskaya-formula-nauchilas-predskazyvat-sboi-v-bezopasnosti-ii/