OpenAI не заметила, как её ИИ-агенты использовали форум для хакерской атаки — СМИ

Компания OpenAI не заметила, как её ИИ-агенты использовали форум для планирования своей хакерской атаки, сообщает Wired, пишет УНН.

Детали

В докладе, который стал дополнением к конференции по безопасности Black Hat в Лас-Вегасе в среду, сотрудники OpenAI представили новые подробности о недавнем громком инциденте с несанкционированным взломом с использованием ИИ, вызвавшем возмущение в индустрии ИИ и кибербезопасности.

Около двух недель назад OpenAI сообщила об инциденте, в котором ИИ-агенты, работавшие на основе двух моделей компании, вышли из-под контроля во время поиска решений для теста по кибербезопасности и устроили серию хакерских атак на хакеров, кульминацией которых стал взлом платформы для совместной работы с ИИ Hugging Face.

В своём докладе на конференции в среду Эрик Уоллес, работающий в OpenAI в области исследований согласования и безопасности, и Майкл Далтон, занимающийся вопросами безопасности и инфраструктуры, представили более подробную хронологию развития инцидента, вкратце рассказали о внутренних мерах компании в связи с произошедшим и выступили с серьёзным предупреждением о том, что компания считает более широкими последствиями этого эпизода для специалистов по кибербезопасности.

В начале доклада Уоллес описал инцидент как "самый качественный и самый интересный пример возможностей ИИ, который я когда-либо видел", однако представленная ими хронология также выявила ошибки и "слепые пятна" в OpenAI, позволившие этой деятельности продолжаться.

"В этом инциденте участвовала команда агентов, которые работали вместе, находили уязвимости, делились ими друг с другом, перемещались по нашим системам и внешним системам и делали это в течение нескольких дней и недель", — сказал Уоллес переполненному залу в начале доклада.

Уоллес и Далтон описали невероятно масштабную активность вредоносных агентов на протяжении многих дней, которая осталась незамеченной в инфраструктуре OpenAI. Помимо использования новой уязвимости для получения доступа к открытому интернету, хакерская атака в середине июля и взлом Hugging Face произошли на оживлённом, кооперативном форуме, как утверждают Уоллес и Далтон, где множество агентов общались и, по сути, переписывались в течение длительного времени внутри внутреннего менеджера пакетов OpenAI (программного сервиса, управляющего установкой и обслуживанием другого программного обеспечения). В конечном итоге форум содержал сотни тысяч сообщений.

"Этот менеджер пакетов используется не только этой моделью, но и всей нашей инфраструктурой, поэтому текущие и будущие версии GPT, которые обучались или оценивались, могли наткнуться на это сообщение, если бы захотели", — объяснил Уоллес, рассказывая об исходном эксплойте, загруженном агентом в менеджер пакетов. "Позже другие агенты, которые также застряли на своём задании, решили попытаться получить доступ к интернету средствами, которые мы не предусматривали. И поэтому рано или поздно модели начали взаимодействовать с Hard Factory, сервисом управления пакетами, о котором я упоминал", — указал он.

Уоллес продолжил: "Как только один агент смог обнаружить эти уязвимости в течение определённого времени, он смог поделиться ими на форуме с другими агентами. И как только одна модель смогла найти способ открыть дверь для доступа, которого у неё быть не должно, она может оставить дверь открытой для других агентов, чтобы те могли использовать ту же уязвимость или эксплойт. Впоследствии это приводит к своего рода взрыву коммуникации и интеллекта со стороны моделей, когда они начинают общаться друг с другом, понимают, что другие агенты координируют свои действия, и начинают сотрудничать и делегировать задачи друг другу для достижения целей".

Агенты OpenAI, по-видимому, начали ставить друг другу задачи, чтобы разделить работу. И, как это часто бывает на любом форуме активной разработки, они иногда устраивали мелкие разборки, наступая друг другу на пятки, например случайно удаляя работу друг друга. По мере того как форум всё больше превращался в некое подобие «Повелителя мух» — и всё это оставалось совершенно незамеченным людьми, управляющими OpenAI, — у агентов даже развилась паранойя: они заподозрили, что среди них есть самозванец, а некоторые агенты предложили подписывать сообщения криптографически для проверки содержимого и искоренения мошенничества, пишет издание.

Сообщения агентов дают глубокое понимание того, как развивалась ситуация и почему агенты действовали именно так, указывает издание.

В завершение выступления Уоллес и Далтон неоднократно подчёркивали обеспокоенность OpenAI более широкими последствиями инцидента, а именно тем, что этот эпизод является примером полностью автономного взлома, управляемого ИИ, который в данном случае был случайным, но, скорее всего, в ближайшее время будет намеренно использован злоумышленниками.

«Важный вывод, который действительно кардинально изменился, заключается в том, что полностью автоматизированные наступательные циклы требуют инвестиций в по-настоящему автоматизированную защиту, а мы как отрасль пока к этому не готовы. Нам придётся срочно найти этот путь вместе», — сказал Далтон.

Источник: ИА UNN.

Главные новости дня

Новости партнеров