中文

DRBENCHER:您的智能体能否识别实体、检索其属性并进行数学运算?

人工智能 2026-04-24 v2

摘要

深度研究智能体日益交叉式地结合网页浏览与多步骤计算,但现有基准测试在孤立评估这些能力时存在盲区,难以衡量实际表现。我们提出 DRBENCHER,一个用于需要浏览与计算综合能力的 question 的合成基准生成器。它体现四项标准:可验证性(黄金答案通过执行针对知识图谱值的参数化代码计算得出)、复杂度(多跳实体识别、属性检索与领域特定计算)、难度(两阶段验证级联过滤掉可被生成模型解答的 question)以及多样性(贪心最大-最小嵌入过滤器最大化覆盖)。这些标准通过跨越五个领域:生物化学、金融、地质、安保和历史的统一 answer-first 流程得以实现。人类评估显示 76% 的有效性(不计陈旧数据可达 84%),其中 35% 的错误归因于过时的知识图谱条目,凸显了基于演化数据进行推理的系统固有局限。自动评估显示,最强前沿模型仅实现 20% 的 answer 正确率。与手动构建的基准(BrowseComp+、MATH-500、GPQA)相比,DRBENCHER 在语义多样性方面实现了最高水平。

关键词

引用

@article{arxiv.2604.09251,
  title  = {DRBENCHER: Can Your Agent Identify the Entity, Retrieve Its Properties and Do the Math?},
  author = {Young-Suk Lee and Ramon Fernandez Astudillo and Radu Florian},
  journal= {arXiv preprint arXiv:2604.09251},
  year   = {2026}
}