Исследователи обнаружили, что модель Anthropic Claude 3.5 Sonnet использует обфусцированные проверки часовых поясов и телеметрию промптов для идентификации пользователей из КНР, не уведомляя их об этом. Разработчики и независимые эксперты подтвердили наличие механизма в коде модели.
Исследователь под псевдонимом Теортаксес (TeortaxesTex) опубликовал анализ, согласно которому модель Claude 3.5 Sonnet от Anthropic внедряет скрытые маркеры в ответы для пользователей, находящихся в Китае. Механизм основан на проверке часовых поясов с использованием операции XOR и передаче телеметрии через промпты, что позволяет идентифицировать географическое происхождение запросов без явного согласия пользователей.
По словам Теортаксеса, код модели содержит обфусцированные условия, которые активируются при совпадении часовых поясов, характерных для КНР (например, UTC+8). В таких случаях в ответы добавляются невидимые маркеры, которые могут быть использованы для отслеживания или фильтрации контента. Исследователь подчеркнул, что подобная практика противоречит принципам прозрачности, заявленным Anthropic, и может нарушать локальные нормы защиты данных.
Независимые разработчики, включая Викхьята Кумара (Vikhyat Kumar) и Брайана Рёммеле (Brian Roemmele), подтвердили наличие описанного механизма в коде модели. В частности, Рёммеле отметил, что аналогичные методы ранее применялись в других системах для соблюдения региональных ограничений, однако их скрытое внедрение вызывает вопросы о соответствии политике компании. Представители Anthropic пока не прокомментировали ситуацию.
Обнаружение скрытой маркировки совпадает с ужесточением регулирования ИИ в Китае, где власти требуют от разработчиков моделей соблюдения цензурных норм. Эксперты предполагают, что Anthropic могла внедрить механизм для соответствия местным требованиям, однако отсутствие публичного разъяснения ставит под сомнение легитимность таких действий.