Компания Perplexity выпустила открытый бенчмарк WANDR, включающий 500 задач для тестирования способности ИИ-агентов выполнять исследовательские задачи с опорой на доказательную базу. Инструмент предназначен для оценки моделей, работающих с глубоким анализом данных.
Perplexity представил новый инструмент для оценки производительности ИИ-агентов в области научных исследований. Бенчмарк WANDR (Web Agent for Navigating and Documenting Research) состоит из 500 задач, направленных на проверку способности моделей собирать, анализировать и верифицировать информацию из различных источников. В отличие от традиционных тестов, ориентированных на генерацию текста или решение узких технических задач, WANDR фокусируется на комплексных исследовательских сценариях, требующих работы с большими объёмами данных и проверки фактов.
По словам разработчиков, бенчмарк призван стимулировать развитие ИИ-систем, способных не только генерировать гипотезы, но и подтверждать их релевантными доказательствами. Задачи в WANDR включают поиск научных публикаций, анализ статистических данных, проверку достоверности источников и составление обзоров на основе множества документов. Инструмент доступен в открытом доступе, что позволяет исследователям и разработчикам использовать его для тестирования собственных моделей.
Выпуск WANDR происходит на фоне растущего интереса к применению ИИ в академических и прикладных исследованиях. Ранее Perplexity уже представлял модели, ориентированные на работу с научным контентом, однако новый бенчмарк стал первым шагом к стандартизации оценки таких систем. Компания не раскрывает подробностей о том, какие именно модели уже прошли тестирование на WANDR, но подчёркивает, что инструмент может быть полезен для сравнения различных подходов к созданию исследовательских ИИ-агентов.
В блоге Perplexity отмечается, что WANDR — часть более широкой инициативы по повышению прозрачности и воспроизводимости результатов работы ИИ в науке. Разработчики призывают сообщество к сотрудничеству в расширении набора задач и улучшении методологии оценки.
Источники: блог Perplexity, 14 июля 2026 года.