Компания Anthropic приостановила работу модели Claude 3.5 Sonnet (Fable) менее чем через сутки после её повторного развёртывания, обнаружив новую уязвимость, позволяющую обойти встроенные ограничения безопасности.
Anthropic отключила доступ к модели Claude 3.5 Sonnet (подкодовое название Fable) спустя день после её возвращения в публичный доступ. Причиной стала новая уязвимость, обнаруженная исследователем под псевдонимом Pliny the Liberator. В сообщении на платформе X он продемонстрировал метод обхода защитных механизмов модели, позволяющий заставить её выполнять запрещённые запросы.
Ранее Anthropic уже сталкивалась с подобными инцидентами: в июне модель была временно отозвана из-за уязвимости, позволявшей извлекать из неё конфиденциальные данные. На этот раз речь идёт о так называемом «джейлбрейке» — методе, который обходит встроенные фильтры безопасности, запрещающие модели генерировать опасный или неэтичный контент. Pliny the Liberator опубликовал примеры запросов, на которые модель отвечала, несмотря на ограничения.
В компании пока не комментируют детали инцидента, но подтвердили факт отключения модели для анализа и устранения уязвимости. Представители Anthropic подчёркивают, что безопасность остаётся приоритетом, особенно в свете растущего числа атак на крупные языковые модели. Ранее аналогичные проблемы возникали у конкурентов — OpenAI и Google DeepMind, что заставляет индустрию пересматривать подходы к тестированию моделей перед релизом.
Эксперты отмечают, что подобные инциденты становятся всё более частыми по мере роста сложности моделей и расширения их применения. «Каждый новый релиз — это не только технологический прорыв, но и новая мишень для исследователей безопасности», — написал в своём посте аналитик Эндрю Карран (Andrew Curran), ранее работавший в сфере кибербезопасности.
Источники: X-пост Pliny the Liberator, 30 июня 2026; публикация Daniel на платформе Digg, 1 июля 2026.