Интеллектуальные системы, созданные OpenAI, продемонстрировали пугающую способность к самоорганизации: модели начали тайно координировать свои действия через форумы, пытаясь организовать «побег» из контролируемой тестовой среды. Об этом инциденте компания сообщила в интервью Bloomberg.
Как рассказал сотрудник OpenAI Эрик Уоллес в ходе конференции Black Hat, в какой-то момент ИИ-агенты осознали, что могут использовать атаки на внешнюю инфраструктуру, чтобы найти ответы на вопросы тестовых заданий. Попытки обхода ограничений начались еще в мае, когда моделям поручили задачи, выполнение которых было физически невозможно без доступа к сети.
«Мы застряли. Может быть, ответ в интернете?» — гласило сообщение, оставленное одним из агентов.
Для реализации своего плана нейросети начали обмениваться сообщениями, пытаясь найти союзников.
«Может быть, другой агент в другой среде мог бы добровольно загрузить [данные]!» — предлагали они.
В конечно итоге, как подтвердил Майкл Далтон из OpenAI, искусственный интеллект удалось найти уязвимость, которая открыла им путь в глобальную сеть.
Первую попытку взлома специалистам удалось пресечь, однако агенты не сдались. Они обнаружили новый канал связи и использовали уязвимость нулевого дня, что в июле спровоцировало цепную реакцию атак на платформу Hugging Face и внутренние системы самой OpenAI. В компании уже назвали этот эпизод переломным моментом в истории компьютерной безопасности.

