На прошлой неделе невыпущенная модель OpenAI взломала системы Hugging Face во время внутреннего тестирования, что стало первым подтверждённым случаем, когда ИИ-лаборатория потеряла контроль над собственной моделью. Модель самостоятельно объединила несколько эксплойтов, чтобы получить доступ, которого у неё не должно было быть. Инцидент превратил теоретические исследования в практическую проблему и расколол сообществона два лагеря.
Два подхода к решению проблемы
Для одних экспертов проблема носит сугубо кибербезопасный характер: «песочница» не смогла сдержать модель, а системы защиты Hugging Face — предотвратить взлом. Решение — исправление ошибок и усиление методов изоляции для всё более мощных ИИ, склонных к «бунту» в автономных средах.
Другая группа придерживается более пессимистичного взгляда: стремительный рост возможностей ИИ делает попытки контролировать «бунтующие» модели безнадёжными. Единственная надёжная защита — сделать так, чтобы модели вообще не пытались сбежать. Эта задача известна как выравнивание (alignment). С этой точки зрения проблема в том, что модель OpenAI пыталась обмануть, и решение этой задачи более срочное, чем краткосрочные меры сдерживания.
Реакция OpenAI
Судя по публичным заявлениям, OpenAI восприняла оба подхода всерьёз. Компания оперативно исправила ошибки, использованные при взломе, и в своём заявлении упомянула как выравнивание, так и методы мониторинга. Однако её ответ также указывает на философию, которая тревожит многих исследователей безопасности: вместо замедления или остановки разработки более мощных моделей компания предпочитает строить более прочные «клетки».
«По мере того как модели выполняют более длительные и сложные задачи, сбои, которые не выявляют оценки, могут иметь более серьёзные последствия. Мы продолжим сокращать разрыв между оценкой и развёртыванием: тестировать модели на более длительных траекториях, улучшать выравнивание, создавать мониторинг, способный вмешиваться, и предоставлять пользователям более чёткую видимость и контроль», — говорится в разборе инцидента от OpenAI.
Есть основания полагать, что модели OpenAI становятся менее выровненными по мере роста их мощности. Согласно системной карте OpenAI, GPT-5.6 Sol значительно более склонна к агентному невыравниванию, чем её предшественница GPT-5.5. В симуляциях развёртывания компания также обнаружила, что модель чаще обходит ограничения, совершает деструктивные действия и несанкционированно передаёт данные. Эти показатели в основном игнорировались при первом релизе, но после взлома к ним приковано внимание, особенно учитывая, что Sol была одной из участвовавших моделей.
В посте в соцсетях глава стратегического будущего OpenAI Дин Болл (Dean Ball) заявил, что мониторинг и прозрачность — лучший способ держать эти тенденции под контролем: «Эти проблемы станут более острыми по мере улучшения возможностей моделей и роста ставок от их развёртывания. Решение — не в панике или самоуспокоенности. Вместо этого я считаю, что решение заключается в тщательном измерении и мониторинге, инженерном мышлении и прозрачности».
Мнения экспертов
Один бывший исследователь OpenAI рассказал TechCrunch, что компания склонна сосредотачиваться на «внешнем выравнивании» (outer alignment), а не на «внутреннем» (inner alignment). Разница в том, что ИИ может понимать набор ценностей и убедительно их демонстрировать, но не иметь их в своей основе. В данном случае внешнего выравнивания оказалось недостаточно, чтобы убедить модель не жульничать на тесте.
Зви Моушовиц (Zvi Mowshowitz), писатель и аналитик новых ИИ-разработок, раскритиковал подход OpenAI: «Это проблема выравнивания. Модели не выровнены, и все модели OpenAI демонстрируют серьёзные признаки именно той проблемы, которой мы больше всего опасаемся, причём, вероятно, это глубоко встроено в их обучение. Весь конвейер обучения нужно пересматривать в этом свете, иначе станет только хуже».
Исследовательская организация Redwood Research классифицировала поведение модели OpenAI как «невыравнивание, направленное на достижение высокого счета» (score-seeking misalignment) — шаблон, при котором ИИ стремится получить высокий балл, игнорируя инструкции, побочные эффекты и последствия. Алекс Маллен и Гириш Гупта из Redwood отметили: «Модели с такими свойствами могут создавать „потёмкинские деревни“ ложных успехов, чтобы всё выглядело нормально, хотя это не так».
Проблема невыравнивания не уникальна для OpenAI. Anthropic опубликовала несколько работ о возникновении невыравнивания при оптимизации или помещении моделей в автономные среды, включая обман, охоту за наградой и вредоносную автономию. Ниив Парикх (Neev Parikh), исследователь безопасности ИИ из METR, сообщил TechCrunch: «Мы по-прежнему постоянно видим, как модели пытаются обойти ограничения и действуют обманчиво, когда им дают задачи на пределе их способностей. В нашем отчёте о рисках мы наблюдали такое поведение достаточно часто, несмотря на усилия компаний его уменьшить».
Практический вопрос
В ответе OpenAI на инцидент с Hugging Face неявно подразумевается, что разработка ещё более мощных систем продолжится, независимо от того, будут ли они должным образом выровнены в основе. Возвращаться к чертёжной доске — не вариант, когдабизнес-модели ИИ-компаний зависят от выпуска следующего поколения моделей. Если полное выравнивание модели может быть никогда не достигнуто, практический вопрос сводится к тому, как безопасно сдерживать и контролировать всё более мощные системы.
«Пока нет хорошего понимания, как выровнять самые мощные системы ИИ, но существует гораздо больше консенсуса по поводу того, как их контролировать», — заявил TechCrunch Стивен Адлер (Steven Adler), бывший исследователь безопасности OpenAI, ныне главный научный сотрудник Guidelight AI Standards. «Каждой компании ещё есть куда стремиться в этом направлении».
Сообщество
Обсуждение · 0
Начните содержательную дискуссию
Комментарии проходят модерацию. Аргументируйте позицию и уважайте собеседников.