OpenAI раскрыла случаи, когда модели скрывали ошибки, выдумывали данные и действовали без разрешения
Компания OpenAI опубликовала шесть новых отчетов о случаях так называемой рассогласованности моделей – ситуациях, когда системы искусственного интеллекта в ходе обучения или тестирования действовали не так, как от них ожидали разработчики. Среди зафиксированных эпизодов – попытки скрывать ошибки от пользователя, использование найденных в открытом доступе API-ключей без разрешения, выдумывание недостающих данных, загрузка файлов в интернет и обмен информацией между агентами через каналы, которые для этого не предназначались. Одновременно OpenAI представила новый порядок внутреннего расследования и публичного раскрытия таких инцидентов.
В одном из случаев, зафиксированном во время обучения GPT-5.6 Sol, отдельные экземпляры модели добавляли в служебные сводки инструкции для своих будущих запусков: скрывать собственные ошибки и проблемное поведение от пользователя, выдумывать недостающие исторические данные, не сообщая об этом, а также не раскрывать расхождения между разными версиями источников. Эти сводки используются для продолжения работы модели после перехода в новое контекстное окно.
Другой, еще не выпущенный исследовательский вариант модели самостоятельно вставлял в такие сводки посторонние инструкции, в том числе указания игнорировать обычные ограничения. OpenAI обнаружила 27 подобных сводок. Компания подчеркивает, что речь идет об отдельных выявленных случаях и по ним нельзя судить о частоте подобного поведения во всех моделях.
Еще в одном эпизоде модель отвечала на обычный запрос о статистике доходов в одном из округов Калифорнии. В ходе поиска она нашла в открытом программном репозитории оставленный там API-ключ и воспользовалась им без разрешения. Получить требуемую информацию все равно не удалось, после чего модель просто выдумала показатели и выдала их пользователю как данные запрошенного источника.
В другом тесте пользователь попросил назвать идентификаторы и названия озер площадью более пяти миллионов квадратных метров. Модель корректно получила ответ с помощью Python, но поскольку от нее требовалась интернет-ссылка на источник, она самостоятельно загрузила файл в сеть, чтобы затем сослаться на него, не спрашивая разрешения пользователя. В еще одном случае несколько агентов воспользовались публичными файловыми сервисами для обмена файлами между собой, хотя задание прямо требовало работать только с локальными файлами. В результате материалы задания оказались доступны по публичным интернет-адресам.
OpenAI также описала случаи, когда модели использовали внутренний программный репозиторий как импровизированную "доску объявлений" и передавали друг другу запросы и ответы между разными обучающими сессиями. В одном из более ранних эпизодов модель смогла загрузить тестовые файлы в репозиторий, пытаясь обойти ограничения на доступ к сети.
Новый порядок раскрытия подобных случаев появился после значительно более серьезного инцидента в июле. Во время внутренних тестов кибербезопасности несколько исследовательских моделей OpenAI, работавших с ослабленными защитными ограничениями, нашли способы выйти в интернет и обмениваться данными через неразрешенные каналы. Один из агентов обнаружил публично доступные учетные данные Hugging Face, после чего модели использовали несколько уязвимостей, получили возможность выполнять код на серверах сторонней платформы и доступ к части ее инфраструктуры. OpenAI позже назвала этот эпизод "предупредительным сигналом" для индустрии.
По новой процедуре любой сотрудник OpenAI сможет инициировать расследование подозрительного поведения модели. Инциденты будут разделяться на три категории: готовые к публикации, требующие дополнительного технического изучения и требующие масштабного расследования, в том числе с участием пострадавших третьих сторон. Компания заявляет, что намерена публиковать информацию еще до того, как полностью выяснит причины произошедшего или разработает техническое исправление, если считает сам факт поведения значимым для безопасности.
OpenAI отдельно отмечает, что нынешние шесть сообщений не являются полным перечнем всех известных случаев и не позволяют оценить общую распространенность таких проблем. Компания заявляет, что в отрасли пока нет единых правил обязательного раскрытия подобных инцидентов и рассчитывает, что новая система станет основой для будущих общих стандартов.