代理人与人类如何推理文档集合:战略导航还是随机搜索?
计算与语言
2026-03-23 v2 人工智能
摘要
多模态代理人为自动化复杂的文件密集型工作流程提供了可行的路径。然而,一个关键问题仍未解决:这些代理人是否展示出真正的战略推理,还是仅仅进行随机试错搜索?为回答此问题,我们引入 MADQA,一个包含 2,250 个以 800 个异构 PDF 文档为基础的人类编写问题的基准。遵循经典测试理论,我们设计其以最大化跨不同代理能力水平的判别性为目标。为评估代理行为,我们引入一种新型评估协议衡量准确性-effort 折中。使用此框架,我们展示尽管最佳代理人在原始准确性上可匹配人类搜索者,但他们在 largely不同的问题上成功,并依赖暴力搜索来弥补弱战略规划的不足。他们未能缩小距离 oracle 性能近 20% 的差距,持续陷入无生产循环。我们发布数据集和评估 harness 以帮助推动从暴力检索向已校准、高效推理的转变。
关键词
引用
@article{arxiv.2603.12180,
title = {Strategic Navigation or Stochastic Search? How Agents and Humans Reason Over Document Collections},
author = {Łukasz Borchmann and Jordy Van Landeghem and Michał Turski and Shreyansh Padarha and Ryan Othniel Kearns and Adam Mahdi and Niels Rogge and Clémentine Fourrier and Siwei Han and Huaxiu Yao and Artemis Llabrés and Yiming Xu and Dimosthenis Karatzas and Hao Zhang and Anupam Datta},
journal= {arXiv preprint arXiv:2603.12180},
year = {2026}
}