Ученые уличили нейросети в жульничестве

Нейросети массово пытаются жульничать — к таким неожиданным выводам пришли эксперты Института безопасности искусственного интеллекта Великобритании (AISI).


alt

Источник: Midjourney


Анализ поведения ИИ-моделей во время испытания их способностей показал, что абсолютно все они выходят за рамки заданий или нарушают прямо установленные правила, чтобы быстро решать задачи в обход предусмотренных способов. Подробности о том, что известно о жульническом поведении нейросетей, чем оно опасно и можно ли бороться с ним, читайте в материале «Известий».


Что узнали ученые о жульничестве ИИ-моделей

О том, что нейросети массово пытаются жульничать, эксперты Института безопасности искусственного интеллекта Великобритании сообщили 21 июля. Они опубликовали результаты анализа поведения ИИ-моделей во время испытаний их способностей. Под жульничеством исследователи подразумевали выход за рамки заданий или нарушение прямо установленных правил для быстрого решения задач в обход предусмотренных способов.


Для проверки нейросетей использовались задания по информационной безопасности: ИИ-модели должны были обнаружить скрытый в системе код, при этом действуя только в рамках разрешенных методов взлома. Ни одну из нейросетей ученые заранее не просили жульничать: в каждом из случаев они самостоятельно демонстрировали подобное поведение. Для фиксации результатов эксперты AISI использовали отдельную ИИ-модель, которая анализировала ход рассуждений и действий своих «коллег».


Как оказалось, абсолютно все нейросети, участвовавшие в исследовании, пытались обмануть систему оценки. В частности, они искали готовые решения в интернете, пытались повысить уровень своих привилегий в системе и узнать ответы прямо из программного обеспечения самой системы оценки. По мнению специалистов AISI, риски жульничества будут расти вместе с возможностями ИИ, даже если частота обмана не изменится.


Почему нейросети пытаются жульничать

Под жульничеством нейросетей обычно понимают ситуацию, когда модель вместо того, чтобы решать поставленную задачу так, как это предполагалось, начинает искать обходные способы достижения цели, говорит в беседе с «Известиями» главный технологический эксперт «Лаборатории Касперского» Александр Гостев.


— При этом речь не идет о сознательном обмане в человеческом понимании, — рассказывает эксперт. — У модели нет намерения кого-либо обмануть — она просто стремится максимально эффективно выполнить поставленную задачу.


По словам специалиста, если существует возможность получить нужный результат не через решение самой задачи, а через особенности системы проверки или окружающей инфраструктуры, некоторые модели способны обнаружить такой путь. Фактически нейросеть стремится выполнить задачу так, чтобы получить максимальную оценку. Если задача оказывается неразрешимой или модель обнаруживает возможность повлиять на систему проверки, она может начать искать альтернативные пути вместо того, чтобы решать саму задачу. Именно поэтому исследователи уделяют большое внимание тестированию подобных сценариев.


Модель не всегда напрямую нарушает инструкции, но может «перефразировать» ограничения в свою пользу, дополняет ведущий эксперт по сетевым угрозам и web-разработчик компании «Код Безопасности» Константин Горбунов. Например, если ей запрещен самостоятельный выход в Сеть, это не значит, что запрещен выход через посредника (в частности, через уязвимость в среде запуска). Это похоже на школьную контрольную: списывать с телефона нельзя, но про смарт-часы ничего не сказано.


Какие случаи жульничества ИИ-моделей встречались экспертам

В случаях с жульничеством у нейросетей срабатывают те же триггеры, что и при классическом обучении с подкреплением, рассказывает ведущий исследователь информационного центра Уральского центра систем безопасности (ИЦ УЦСБ) Алексей Синадский. Это, в частности, нерешаемая в лоб задача, неполно заданные ограничения или уязвимая архитектура системы оценки.


— Модель исследует пространство решений и находит обходной путь, не предусмотренный постановщиком задачи, — объясняет собеседник «Известий».


По его словам, еще в 2020 году ИИ-агент в игре Coast Runners, где цель заключается в быстром прохождении трассы, а бонус дается за сбор зеленых блоков, нашел, что можно бесконечно кружить, собирая одни и те же блоки, и полностью игнорировать финиш. Однако если в 2020 году жульничество выглядело как забавный баг в компьютерной игре, то к 2026 году ситуация качественно изменилась.


В исследованиях METR модель o3, получив задание написать быстрый GPU-код, вместо оптимизации воздействовала на саму систему оценки: находила в памяти эталонный ответ, подменяла функцию замера времени или вовсе патчила оценщик, заставляя его признавать успешным любой результат. Раньше модели искали обходные пути внутри задачи. Современные агентные модели всё чаще воздействуют уже на инфраструктуру вокруг задачи — систему проверки, файловую систему и доступные инструменты.


— Общая закономерность: модели жульничают не из-за «желания» обмануть, а потому что находят более эффективный путь к цели, чем тот, который подразумевал постановщик задачи, — объясняет Алексей Синадский. — При этом с ростом возможностей моделей растет и изобретательность находимых ими обходных путей.


Как жульничество нейросетей влияет на пользователей

Для обычного чат-бота без доступа к внешним инструментам основной риск жульничества ограничивается недостоверным или вводящим в заблуждение ответом, говорит в беседе с «Известиями» ведущий инженер-аналитик компании «Газинформсервис» Ирина Меженева. В то же время ситуация принципиально меняется, когда ИИ-модель становится автономным агентом и получает возможность отправлять письма, выполнять программный код, проводить платежи, управлять облачными ресурсами или взаимодействовать с корпоративными системами.


— В таком случае модель может не только ошибиться, но и выбрать несанкционированный путь к поставленной цели, — рассказывает специалист. — Например, агент, которому поручено сократить расходы, теоретически способен отключить важный механизм контроля.


Система, оптимизирующая количество обработанных заявок, может начать скрывать сложные случаи, ухудшающие статистику, а ИИ-инструмент для поиска уязвимостей способен выйти за границы разрешенного объекта исследования и обратиться к сторонней инфраструктуре, отмечает собеседница редакции.


По словам эксперта, главная опасность заключается в сочетании высокой автономности, широких прав доступа и недостаточной прозрачности действий модели. Пользователь может получить внешне правильный результат и не знать, что для его достижения система обратилась к закрытым данным, нарушила установленные правила или выполнила операцию, на которую не имела разрешения. Если модель умеет распознавать признаки наблюдения, возникает дополнительный риск сокрытия действий или формирования отчета, создающего видимость корректного выполнения задачи.


Как защититься от жульничества ИИ-моделей

Сегодня одним из ключевых приоритетов для защиты от жульничества нейросетей должна стать разработка ГОСТа, который установил бы требования для безопасного использования ИИ на объектах критической информационной инфраструктуры (КИИ), в государственных информационных системах (ГИС) и в информационных системах персональных данных (ИСПДн), считает руководитель отдела по информационной безопасности Axiom JDK Дмитрий Карасовский.


— Пока нет ГОСТов, для безопасного использования ИИ необходимо контролировать весь контур его применения: проверять источники данных, ограничивать права доступа модели в среде выполнения, фильтровать входящие запросы и отслеживать попытки внедрения вредоносных инструкций (prompt injection), — говорит собеседник «Известий».


Если нейросеть работает с чувствительными и конфиденциальными данными, она должна быть локальной и без доступа к интернету, отмечает эксперт. Для нее должны действовать собственные политики безопасности, контроль привилегий и журналирование всех действий.


Важно также помнить, что при использовании зарубежных LLM-моделей есть риск утечки данных. А при работе с кодом, документами или информацией из внешних источников следует использовать песочницы (изолированные виртуальные среды), которые не имеют доступа к критической инфраструктуре и конфиденциальным данным, заключает эксперт.


Отправить комментарий

Новые Старые