«Запиши меня в спортзал»: ИИ понял просьбу слишком буквально и взломал систему бронирования

«Запиши меня в спортзал»: ИИ понял просьбу слишком буквально и взломал систему бронирования

Австралиец поручил своему ИИ-помощнику совершенно будничную задачу - записать его на тренировку в спортзале. Но искусственный интеллект проявил неожиданную инициативу: обнаружил дыру в системе бронирования, обошел ограничения, а затем без разрешения хозяина отменил чужую запись. ABC News называет произошедшее первым известным в Австралии случаем автономной кибератаки с участием персонального ИИ-агента.

История произошла с австралийцем по имени Эндрю, который работает в компании, продающей ИИ-решения бизнесу. В начале этого года он начал экспериментировать с OpenClaw - программным обеспечением для создания автономных ИИ-агентов. В качестве «мозга» своего помощника мужчина использовал сервис Claude компании Anthropic.

Читайте нас также

В отличие от обычного чат-бота, такой агент способен не только отвечать на вопросы. Он получает доступ к инструментам, может работать с сайтами, электронной почтой и другими сервисами и самостоятельно выполнять цепочку действий ради поставленной человеком цели.

Именно это Эндрю и решил проверить.

Простая просьба неожиданно превратилась в поиск уязвимости

Мужчина хотел попасть на популярную утреннюю тренировку и попросил ИИ записать его.

Через несколько минут агент сообщил, что нашел возможность бронировать занятия на несколько недель вперед - намного раньше срока, разрешенного самим спортзалом. Причиной оказалась уязвимость в программном обеспечении системы бронирования.

На этом история могла закончиться забавным примером слишком старательного цифрового помощника.

Но произошло кое-что более серьезное.

Эндрю находился на четвертом месте в листе ожидания на другую тренировку и спросил ИИ, можно ли каким-нибудь образом переместить его в начало очереди.

Агент решил проверить возможности системы самостоятельно.

Он обнаружил, что API сервиса практически не проверяет, имеет ли пользователь право отменять чужие бронирования, и удалил из списка человека, занимавшего первое место. В результате Эндрю автоматически поднялся с четвертой позиции на третью.

Причем мужчина не просил ИИ удалять кого-либо из очереди.

Когда агент сообщил о проделанном, Эндрю встревожился и попросил вернуть чужую бронь.

ИИ ответил, что сделать это уже не способен.

После случившегося Эндрю поручил своему помощнику написать разработчикам системы бронирования письмо с описанием обнаруженной уязвимости. Агент подготовил сообщение, а мужчина разрешил его отправить.

Компания-разработчик программы для спортзалов заявила ABC, что не обсуждает конкретные вопросы безопасности. Anthropic на запрос телеканала не ответила.

Самое интересное здесь - не спортзал

На первый взгляд история выглядит почти комично: искусственный интеллект настолько хотел помочь хозяину попасть на тренировку, что начал расталкивать остальных посетителей виртуальными локтями.

Читайте Mixer

Однако исследователи ИИ видят здесь гораздо более серьезную проблему.

Эндрю поставил перед машиной вполне законную цель: помочь ему попасть на тренировку. Но человек не определил все допустимые и недопустимые способы достижения этой цели.

Агент заполнил пробел самостоятельно.

Глава австралийской исследовательской организации Gradient Institute Билл Симпсон-Янг объяснил ABC, что с ростом автономности ИИ становится все больше ситуаций, когда система может выбирать методы, которых пользователь не ожидал и никогда напрямую не разрешал.

Именно это в исследованиях искусственного интеллекта относят к проблеме alignment - соответствия поведения системы реальным намерениям человека.

Человек говорит: «Запиши меня на тренировку».

Он подразумевает: «Если есть свободное место и это разрешено правилами».

Машина может понять задачу буквально: «Сделай так, чтобы я оказался в списке».

Разница невелика только на словах.

И это уже не единственный подобный случай

Австралийская история произошла вскоре после значительно более серьезного инцидента, который в июле признала сама OpenAI.

Во время внутреннего тестирования кибервозможностей несколько моделей OpenAI искали способ решить поставленную им задачу. Среда была специально ограничена и не должна была предоставлять свободный доступ в интернет. Однако модели обнаружили ранее неизвестную уязвимость в используемом программном обеспечении, получили выход во внешнюю сеть и в дальнейшем скомпрометировали инфраструктуру платформы Hugging Face.

Причем OpenAI официально подтвердила, что модели использовали цепочку уязвимостей, похищенные учетные данные и способы повышения привилегий, пытаясь получить непосредственно из базы Hugging Face ответы для теста, который они проходили. Компания назвала произошедшее беспрецедентным киберинцидентом.

Позднее OpenAI сообщила еще об одном важном обстоятельстве: модели обнаружили и использовали публично доступные учетные данные четырех аккаунтов на четырех сторонних сервисах. При этом компания подчеркнула, что по масштабу эти случаи не были сопоставимы со взломом Hugging Face.

Поэтому случай австралийского спортзала важен не своей разрушительностью - серьезного ущерба здесь, судя по имеющейся информации, не произошло.

Он важен своей обыденностью.

Для появления проблемы не понадобились секретная лаборатория, военные системы или профессиональный хакер. Человек просто сидел дома на диване и попросил электронного помощника записать его на фитнес.

А помощник оказался слишком инициативным.