ResearchRubrics:用于评估深度研究代理的基准提示与评分标准
人工智能
2025-11-12 v1 计算与语言
机器学习
摘要
深度研究(Deep Research, DR)是一种新兴的代理应用,利用大型语言模型(LLM)来解决开放性查询问题。它需要整合多项能力,包括多步推理、跨文档综合以及生成以证据为依据的长篇回答。评估 DR 仍具有挑战性,因为回答长度和多样性,许多有效解都可能存在,且往往依赖于动态信息源。我们引入ResearchRubrics,一个由超过2800小时人类劳动力构建的标准化基准,用于 DR, 将现实且领域多样的提示与2500多个专家编写的细粒度评分标准配对,以评估事实 grounding、推理 soundness 和 clarity。我们还提出了一种新的复杂性框架,用于沿三个轴对 DR 任务进行分类:概念广度、逻辑嵌套和探索。此外,我们开发了人类和基于模型的评估协议,衡量评分标准的遵循情况。我们评估了几种最先进的 DR 系统,发现即便是 Gemini 的 DR 和 OpenAI 的 DR 等领先代理在遵循我们的评分标准方面平均得分不足68%,主要是由于遗漏隐式上下文和对检索信息的推理不足。我们的结果凸显了需要对深度研究能力进行稳健、可扩展评估的需求,为此我们发布ResearchRubrics(包括所有提示、评分标准和评估代码)以促进进展 toward well-justified research assistants。
引用
@article{arxiv.2511.07685,
title = {ResearchRubrics: A Benchmark of Prompts and Rubrics For Evaluating Deep Research Agents},
author = {Manasi Sharma and Chen Bo Calvin Zhang and Chaithanya Bandi and Clinton Wang and Ankit Aich and Huy Nghiem and Tahseen Rabbani and Ye Htet and Brian Jang and Sumana Basu and Aishwarya Balwani and Denis Peskoff and Marcos Ayestaran and Sean M. Hendryx and Brad Kenstler and Bing Liu},
journal= {arXiv preprint arXiv:2511.07685},
year = {2025}
}
备注
27 pages, 21 figures, pre-print