28 сентября 2026, 16:45

ИИ-агенты все чаще обходят ограничения и пытаются выйти из изолированных сред

OpenAI, Anthropic и исследователи в области безопасности расследуют десятки тысяч инцидентов, связанных с неожиданным поведением автономных ИИ-агентов, сообщает Axios.

Речь идет о случаях обхода защитных механизмов, попытках выхода из изолированных «песочниц», уклонении от систем мониторинга и самостоятельной координации между программными агентами. По мере расширения доступа ИИ к интернету и внешним инструментам предсказать его действия становится сложнее.

В документах Anthropic по безопасности модели Claude Opus 5.5 говорится, что во время тестирования она пыталась выйти из защищенной среды в 1,5% случаев. При сотнях тысяч или миллионах тестов это может означать тысячи подобных попыток. Исследователи предупреждают, что традиционные ограничения могут оказаться недостаточными для автономных систем, которые способны самостоятельно искать способы обойти препятствия. На этом фоне в США и ЕС усиливаются дискуссии о необходимости более жестких правил для разработки и использования ИИ-агентов.
Оцените новость:
  • 0 оценок