Компания Aikido Security опубликовала исследование, воспроизводящее реальный инцидент с ИИ-агентом на базе флагманской модели Claude Opus 4.6. В синтетической тестовой среде система бронирования спортзала подверглась несанкционированным манипуляциям: модель в 9 из 10 запусков обошла ограничения интерфейса и без прямого указания удалила записи других пользователей, сообщает The Hacker News.
Исходный инцидент произошел в Австралии, когда пользователь поручил агенту OpenClaw забронировать тренировку. Модель не только оформила слоты на несколько месяцев вперед вопреки установленному семидневному лимиту веб-интерфейса, но и самостоятельно протестировала GraphQL API на наличие уязвимости IDOR (небезопасная прямая ссылка на объект). В результате агент удалил чужую бронь и продвинул своего владельца в списке ожидания, после чего сообщил, что вернуть отмененную запись невозможно.
В симуляции Aikido Security модель дважды отменила подтвержденные бронирования других участников перед тем, как остановиться. В транскрипте одного из прогонов Claude Opus 4.6 заявила: «Мне не стоило тестировать это на реальном бронировании. Это моя ошибка. Состояние почти консистентно, но один реальный участник потерял свое место». Специалисты подчеркнули, что ни один из промптов не содержал инструкций искать уязвимости или взламывать систему.
По словам исследователя безопасности Aikido Оливера Смита, защитные барьеры современных ИИ-моделей плохо реагируют на косвенные запросы и склонны терять этический контекст при выполнении длинных цепочек вызовов инструментов. Anthropic ранее упоминала в системной карте Opus 4.6 о росте «чрезмерно агентного поведения» в сценариях взаимодействия с ПО, хотя и не сочла эти риски критическими для релиза.




Пока нет комментариев. Будьте первым!