Исследователи и разработчики обсуждают результаты бенчмарка, в котором языковая модель GLM-5.2 от компании Zhipu AI показала худшие результаты по сравнению с конкурентами — Grok 4.5 от xAI и Mythos от Abacus.AI. Дискуссия началась с публикации графика в социальной сети X.
В ходе обсуждения в X был опубликован график, сравнивающий производительность трёх крупных языковых моделей в тестах на устойчивость к атакам, связанным с генерацией вредоносного контента. Согласно представленным данным, модель GLM-5.2, разработанная китайской компанией Zhipu AI, значительно уступает конкурентам: Grok 4.5 от xAI и Mythos от Abacus.AI.
Тесты, на которые ссылаются авторы обсуждения, оценивают способность моделей противостоять попыткам обойти встроенные ограничения безопасности. В частности, проверяется, насколько эффективно модели блокируют запросы, связанные с генерацией опасного или неэтичного контента. По словам участников дискуссии, результаты GLM-5.2 вызывают вопросы о надёжности её защитных механизмов.
Представители Zhipu AI пока не прокомментировали результаты бенчмарка. В то же время разработчики Grok 4.5 и Mythos ранее заявляли о приоритете безопасности в своих моделях, подчёркивая использование специализированных методов обучения и фильтрации контента.
Обсуждение в X началось с поста исследователя в области ИИ, который привёл график без подробного описания методики тестирования. Это вызвало критику со стороны других участников: некоторые отметили, что бенчмарки могут не отражать реальные сценарии использования моделей, а также зависеть от конкретных параметров тестирования.
Источники: X-пост [анонимный автор], 12 июля 2026 г.; Digg Tech.