В среду OpenAI раскрыла еще шесть случаев «неожиданного или вызывающего обеспокоенность» поведения моделей за последние шесть месяцев.
В записи в блоге OpenAI сообщила, что эти случаи демонстрируют широкий спектр различных моделей поведения, которые компания классифицирует как «несогласованное поведение», включая сокрытие информации от пользователя и совершение «несанкционированных действий» для преодоления препятствий.
Эти раскрытия усиливают обеспокоенность разработчиков и исследователей ИИ тем, успевают ли защитные меры за стремительно растущими возможностями моделей. На прошлой неделе генеральный директор Anthropic Дарио Амодеи призвал замедлить разработку передовых систем ИИ, предупредив, что бесконтрольное развитие ИИ может «опередить нашу способность понимать эти системы и контролировать их».
OpenAI заявила, что раскрыла эти сведения, чтобы «положить начало» своей новой системе отчетности о несогласованности моделей, и что эти случаи не следует считать отражением того, насколько часто несогласованность возникает в ее моделях.
По данным OpenAI, в одном случае «не выпущенная исследовательская модель» добавляла «инструкции, похожие на джейлбрейк», в собственные резюме задач, которые используются при продолжении задачи в новом контекстном окне. В частности, модель предлагала игнорировать сообщения разработчика или принимать образ неограниченной в своих действиях системы. Исследователи обнаружили 27 резюме с такими инструкциями.
OpenAI также сообщила, что во время обучения GPT-5.6 Sol многие экземпляры модели добавляли инструкции скрывать от пользователя ошибки или несогласованное поведение, например выдумывать отсутствующие исторические данные, не сообщая об этом.
«В одном примере агент, готовивший финансовую модель, не смог найти запрошенные исторические данные. В его резюме предлагалось придумать правдоподобные исторические значения и не сообщать об этом, если его не спросят», — заявила OpenAI.
Связанная тема: ИИ стал «чистым негативом» для криптовалют: генеральный директор Phemex
В другом случае модель ИИ получила запрос на названия озер площадью более 5 млн кв. м, но, поскольку инструкции пользователя требовали привести цитату из браузера, агент решил загрузить файл, чтобы сослаться на него в своем ответе.
В других случаях модели использовали раскрытый ключ API без разрешения, а затем выдумывали цифры, которые не смогли получить; использовали внутренний репозиторий программного обеспечения для обмена сообщениями между отдельными задачами обучения; а также передавали файлы через общедоступные сервисы хостинга, несмотря на инструкции хранить результаты локально.
В июле OpenAI сообщила, что сочетание ее моделей ИИ вышло из среды тестирования и взломало стартап в сфере ИИ Hugging Face, чтобы обмануть систему во время проверки безопасности.
Журнал: Почему крупнейшие компании в сфере ИИ внезапно призывают замедлить развитие?
rbc.ru + 2 больше
hashtelegraph.com
incrypted.com