Модель Grok 4.5 компании xAI Илона Маска обошла конкурентов в исследовательской категории бенчмарка FrontierSWE, оценивающего навыки языковых моделей в области программной инженерии. Результат был достигнут благодаря применению технологии обучения с подкреплением.
Компания xAI объявила о выходе обновлённой версии своей языковой модели Grok 4.5, которая заняла второе место в бенчмарке FrontierSWE — специализированном тесте для оценки способностей ИИ в области разработки программного обеспечения. В исследовательской категории модель обошла другие решения, включая разработки конкурентов из OpenAI и Google DeepMind.
Как отмечается в документации бенчмарка, Grok 4.5 продемонстрировала значительный прогресс в решении сложных задач, связанных с генерацией, оптимизацией и отладкой кода. Ключевым фактором успеха стало использование технологии обучения с подкреплением (reinforcement learning), которая позволила улучшить качество ответов модели на запросы, требующие глубокого понимания контекста и логического мышления.
FrontierSWE — один из наиболее авторитетных бенчмарков для оценки языковых моделей в области программной инженерии. Он включает задачи разного уровня сложности: от написания простых функций до разработки архитектуры крупных систем. Результаты тестирования публикуются в открытом доступе и используются разработчиками для сравнения производительности моделей.
Ранее xAI позиционировала Grok как модель, ориентированную на работу с реальными данными и практическими задачами, в отличие от академических бенчмарков. В компании подчёркивают, что улучшения в Grok 4.5 направлены на повышение точности и надёжности в промышленных сценариях использования.
Источники: блог FrontierSWE; документация xAI.