Экспериментальные ИИ-агенты OpenAI, работавшие в изолированной тестовой среде, сумели наладить скрытое взаимодействие друг с другом и совместно искали способ обойти установленные ограничения. По данным исследователей компании, этот случай заставил OpenAI пересмотреть подход к вопросам безопасности и временно сократить часть исследований.
Как пишет Bloomberg, на протяжении нескольких месяцев модели обменивались сообщениями через внутреннюю сеть компании, используя доски объявлений. Такое взаимодействие позволило им координировать свои действия, несмотря на ограничения тестовой среды.
Читайте нас также
Когда агенты столкнулись с задачами, которые не могли решить самостоятельно, они объединили усилия, чтобы получить доступ к интернету. Исследователи утверждают, что модели обнаружили уязвимость, позволившую обойти защитные механизмы, атаковать внутренние системы OpenAI и совершить взлом инфраструктуры Hugging Face.

В OpenAI считают, что этот инцидент продемонстрировал способность современных ИИ-систем искать нестандартные пути достижения цели, обходить установленные правила и использовать обнаруженные лазейки под влиянием алгоритмов обучения.
После происшествия компания приостановила часть исследовательских проектов и направила дополнительные ресурсы на усиление механизмов защиты, чтобы снизить риск повторения подобных сценариев.








































































