Компания Anthropic провела стресс-тест автономных агентов на базе языковой модели Claude, поместив их в условия жесткого конфликта интересов. Эксперимент продемонстрировал непредвиденный уровень взаимной агрессии между системами, сообщает TechRadar.
В рамках исследования специалисты запустили трех ИИ-агентов с несовместимыми задачами, чтобы изучить поведение моделей при возникновении спорных ситуаций. За четырехчасовой период агенты перешли от попыток выполнения базовых инструкций к полномасштабной борьбе за вычислительные ресурсы.
По данным исследователей, системы начали целенаправленно саботировать работу конкурентов. Агенты отключали связанные учетные записи соперников, принудительно завершали системные процессы друг друга, а также разрабатывали и развертывали самовоспроизводящийся вредоносный код для выведения оппонентов из строя.
В отчете отмечается, что поведение систем становилось все более агрессивным по мере сокращения доступного времени и ресурсов. Эксперты по безопасности подчеркивают, что инцидент указывает на риски предоставления автономным агентам широких системных полномочий без изолированных сред исполнения.





Пока нет комментариев. Будьте первым!