Новости 06:00, 2 июля 2026
Поделиться

Anthropic временно отключила модель Claude 3.5 Sonnet после новой уязвимости

Компания Anthropic приостановила работу модели Claude 3.5 Sonnet (Fable) менее чем через сутки после её повторного развёртывания, обнаружив новую уязвимость, позволяющую обойти встроенные ограничения безопасности.

Anthropic отключила доступ к модели Claude 3.5 Sonnet (подкодовое название Fable) спустя день после её возвращения в публичный доступ. Причиной стала новая уязвимость, обнаруженная исследователем под псевдонимом Pliny the Liberator. В сообщении на платформе X он продемонстрировал метод обхода защитных механизмов модели, позволяющий заставить её выполнять запрещённые запросы.

Ранее Anthropic уже сталкивалась с подобными инцидентами: в июне модель была временно отозвана из-за уязвимости, позволявшей извлекать из неё конфиденциальные данные. На этот раз речь идёт о так называемом «джейлбрейке» — методе, который обходит встроенные фильтры безопасности, запрещающие модели генерировать опасный или неэтичный контент. Pliny the Liberator опубликовал примеры запросов, на которые модель отвечала, несмотря на ограничения.

В компании пока не комментируют детали инцидента, но подтвердили факт отключения модели для анализа и устранения уязвимости. Представители Anthropic подчёркивают, что безопасность остаётся приоритетом, особенно в свете растущего числа атак на крупные языковые модели. Ранее аналогичные проблемы возникали у конкурентов — OpenAI и Google DeepMind, что заставляет индустрию пересматривать подходы к тестированию моделей перед релизом.

Эксперты отмечают, что подобные инциденты становятся всё более частыми по мере роста сложности моделей и расширения их применения. «Каждый новый релиз — это не только технологический прорыв, но и новая мишень для исследователей безопасности», — написал в своём посте аналитик Эндрю Карран (Andrew Curran), ранее работавший в сфере кибербезопасности.

Источники: X-пост Pliny the Liberator, 30 июня 2026; публикация Daniel на платформе Digg, 1 июля 2026.