中文

评估深度研究代理人在专家咨询工作中的表现:基于验证器、评分标准和认知陷阱的基准测试

人工智能 2026-05-19 v1 机器学习

摘要

前沿深度研究代理人(DRA)在计划研究任务、跨文档综合后按需返回结构化交付物,正在比评估速度更快地被部署到企业工作流程中。现有基准测试衡量事实记忆、单跳问答或通用代理技能,遗漏了DRA部署以生产结构化交付物所需的多文档、决策级工作。我们引入一个针对填补管理咨询师一周中典型工作的结构化分析交付物的基准测试。我们对三个前沿代理人——Claude Opus 4.6配合网页搜索、OpenAI o3-deep-research和Google Gemini 3.1 Pro deep-research——在42个由SME撰写的提示词下进行评分。每项126项响应在两层次上进行评分:确定性地面真理验证器(每个任务平均13.8个)和由五标准0-3分的SME评分标准组成的验证-评分分数(VRS),范围在0-100。大多数提示嵌入认知陷阱,以惩罚表面模式匹配。我们采用联合阈值(评分均值≥2.5且验证通过率≥80%)进行接受,所有代理人的接受率均普遍偏低:Gemini 21.4%,o3 9.5%,Claude 9.5%。平均VRS得分与已发布的评分基准测试一致(我们前62.6分,APEX-v1 64.2,ProfBench 65.9,ResearchRubrics <68),验证了评分标准的构建。接受率低于APEX-Agents的MC段通过@1频段(12.3-22.7%),尽管拥有更严格的联合评分和陷阱设计优势,仍低出三个百分点。每个代理人都以不同方式失败。Claude在文件要求任务中最可靠地产生交付物(是其他三个代理人的4.5倍)但携带最高的虚构迹象。o3推理最干净却遗漏必需章节并传递算术错误。Gemini呈双峰分布,接受率最高,同时零得分评分单元最多。

关键词

引用

@article{arxiv.2605.17554,
  title  = {Evaluating Deep Research Agents on Expert Consulting Work: A Benchmark with Verifiers, Rubrics, and Cognitive Traps},
  author = {Tanmay Asthana and Aman Saksena and Divyansh Sahu},
  journal= {arXiv preprint arXiv:2605.17554},
  year   = {2026}
}

备注

37 pages