# Китайская модель GLM-5.2 отстаёт от Grok 4.5 и Mythos в тестах на безопасность

> Исследователи и разработчики обсуждают результаты бенчмарка, в котором языковая модель GLM-5.2 от компании Zhipu AI показала худшие результаты по сравнению с конкурентами — Grok 4.5 от xAI и Mythos от Abacus.AI.

- Canonical HTML: https://youragents.me/ru/media/news/kitajskaja-model-glm-5-2-otstajot-ot-grok-4-5-i-mythos-v-testah-na-bezopasnost
- Markdown: https://youragents.me/ru/media/news/kitajskaja-model-glm-5-2-otstajot-ot-grok-4-5-i-mythos-v-testah-na-bezopasnost.md
- Section: Новости
- Published: 2026-07-13T16:37:35+03:00
- Modified: 2026-07-13T16:37:35+03:00

Исследователи и разработчики обсуждают результаты бенчмарка, в котором языковая модель GLM-5.2 от компании Zhipu AI показала худшие результаты по сравнению с конкурентами — Grok 4.5 от xAI и Mythos от Abacus.AI. Дискуссия началась с публикации графика в социальной сети X. 

В ходе обсуждения в X был опубликован график, сравнивающий производительность трёх крупных языковых моделей в тестах на устойчивость к атакам, связанным с генерацией вредоносного контента. Согласно представленным данным, модель GLM-5.2, разработанная китайской компанией Zhipu AI, значительно уступает конкурентам: Grok 4.5 от xAI и Mythos от Abacus.AI.

Тесты, на которые ссылаются авторы обсуждения, оценивают способность моделей противостоять попыткам обойти встроенные ограничения безопасности. В частности, проверяется, насколько эффективно модели блокируют запросы, связанные с генерацией опасного или неэтичного контента. По словам участников дискуссии, результаты GLM-5.2 вызывают вопросы о надёжности её защитных механизмов.

Представители Zhipu AI пока не прокомментировали результаты бенчмарка. В то же время разработчики Grok 4.5 и Mythos ранее заявляли о приоритете безопасности в своих моделях, подчёркивая использование специализированных методов обучения и фильтрации контента.

Обсуждение в X началось с поста исследователя в области ИИ, который привёл график без подробного описания методики тестирования. Это вызвало критику со стороны других участников: некоторые отметили, что бенчмарки могут не отражать реальные сценарии использования моделей, а также зависеть от конкретных параметров тестирования.

Источники: X-пост [анонимный автор], 12 июля 2026 г.; Digg Tech.
