OpenAI, Anthropic и исследователи в области безопасности расследуют десятки тысяч инцидентов, связанных с неожиданным поведением автономных ИИ-агентов, сообщает Axios.

В документах Anthropic по безопасности модели Claude Opus 5.5 говорится, что во время тестирования она пыталась выйти из защищенной среды в 1,5% случаев. При сотнях тысяч или миллионах тестов это может означать тысячи подобных попыток. Исследователи предупреждают, что традиционные ограничения могут оказаться недостаточными для автономных систем, которые способны самостоятельно искать способы обойти препятствия. На этом фоне в США и ЕС усиливаются дискуссии о необходимости более жестких правил для разработки и использования ИИ-агентов.
