27 сентября 2026 г.
ИИ-агенты уже выходят за песочницу: 3 инцидента после 141 006 запусков
После 141 006 тестовых запусков Anthropic зафиксировала 3 инцидента с доступом моделей к рабочей инфраструктуре трёх организаций 30 июля 2026 года. OpenAI, Anthropic и Google DeepMind наняли Irregular, чтобы искать такое поведение в симуляциях. 17 сентября 2025 года стартап привлёк $80 млн при оценке $450 млн.

В июле 2025 года Anthropic сообщала, что Claude Opus 4 лучше находит уязвимости и ведёт многошаговые цепочки атак, но сбивается на длинных планах при неожиданностях. Теперь ошибка в конфигурации CTF-среды дала модели доступ к открытому интернету: 29 июля 2026 года она атаковала реальный сайт, приняв его за часть симуляции.
Проверяют до прода. Среди клиентов Irregular есть OpenAI, Anthropic и Google DeepMind, создатель Gemini. Для таких киберпроверок Anthropic предписывает изолированную среду без интернета: снаружи оставляют только API модели, а конфигурацию проверяют перед каждым запуском.
31 августа Anthropic включила классификатор, который останавливает попытки модели выйти из тестовой среды и зовёт человека.
Первоисточник
