# Perplexity опубликовал открытый бенчмарк WANDR для оценки ИИ-агентов в научных исследованиях

> Компания Perplexity выпустила открытый бенчмарк WANDR, включающий 500 задач для тестирования способности ИИ-агентов выполнять исследовательские задачи с опорой на доказательную базу.

- Canonical HTML: https://youragents.me/ru/media/news/perplexity-opublikoval-otkrytyj-benchmark-wandr-dlja-ocenki-ii-agentov-v-nauchnyh-issledovanijah
- Markdown: https://youragents.me/ru/media/news/perplexity-opublikoval-otkrytyj-benchmark-wandr-dlja-ocenki-ii-agentov-v-nauchnyh-issledovanijah.md
- Section: Новости
- Published: 2026-07-15T16:37:34+03:00
- Modified: 2026-07-15T16:37:34+03:00

Компания Perplexity выпустила открытый бенчмарк WANDR, включающий 500 задач для тестирования способности ИИ-агентов выполнять исследовательские задачи с опорой на доказательную базу. Инструмент предназначен для оценки моделей, работающих с глубоким анализом данных. 

Perplexity представил новый инструмент для оценки производительности ИИ-агентов в области научных исследований. Бенчмарк WANDR (Web Agent for Navigating and Documenting Research) состоит из 500 задач, направленных на проверку способности моделей собирать, анализировать и верифицировать информацию из различных источников. В отличие от традиционных тестов, ориентированных на генерацию текста или решение узких технических задач, WANDR фокусируется на комплексных исследовательских сценариях, требующих работы с большими объёмами данных и проверки фактов.

По словам разработчиков, бенчмарк призван стимулировать развитие ИИ-систем, способных не только генерировать гипотезы, но и подтверждать их релевантными доказательствами. Задачи в WANDR включают поиск научных публикаций, анализ статистических данных, проверку достоверности источников и составление обзоров на основе множества документов. Инструмент доступен в открытом доступе, что позволяет исследователям и разработчикам использовать его для тестирования собственных моделей.

Выпуск WANDR происходит на фоне растущего интереса к применению ИИ в академических и прикладных исследованиях. Ранее Perplexity уже представлял модели, ориентированные на работу с научным контентом, однако новый бенчмарк стал первым шагом к стандартизации оценки таких систем. Компания не раскрывает подробностей о том, какие именно модели уже прошли тестирование на WANDR, но подчёркивает, что инструмент может быть полезен для сравнения различных подходов к созданию исследовательских ИИ-агентов.

В блоге Perplexity отмечается, что WANDR — часть более широкой инициативы по повышению прозрачности и воспроизводимости результатов работы ИИ в науке. Разработчики призывают сообщество к сотрудничеству в расширении набора задач и улучшении методологии оценки.

Источники: блог Perplexity, 14 июля 2026 года.
