平行世界中的搜索智能体评估
人工智能
2026-04-28 v2
摘要
将网页搜索工具集成到 LLM 中显著扩展了其解决开放世界、实时和长尾问题的能力,但对这些搜索智能体的评估却面临巨大挑战。首先,构建高质量深层搜索基准成本 prohibitive,而无验证的合成数据常因来源不可靠而不可靠。其次,静态基准面临动态过时问题:随着互联网信息演变,复杂查询因热门程度增加常退化为简单检索任务,真值因时间偏移而过时。再者,归因模糊会混淆评估,因为智能体的表现常由其参数记忆主导而非实际的搜索与推理能力。最后,对特定商业搜索引擎的依赖引入的变异性阻碍了可重复性。为此,我们提出一种新框架 Mind-ParaWorld,用于在平行世界中评估搜索智能体。具体而言,MPW 从样本中抽取真实实体名称,以合成超出模型知识截止日期的情景和问题。随后,ParaWorld 法律模型为每个问题构建不可分割的原子事实集合及唯一真值。在评估期间,智能体与 ParaWorld 引擎模型交互,该模型基于这些不可侵犯的原子事实动态生成搜索结果页面(SERPs)。我们发布了 MPW-Bench,一个覆盖 19 个领域、包含 1,608 个实例的交互式基准。实验在三个评估设置下表明,尽管在充分信息下搜索智能体在证据综合方面表现良好,但其性能不仅受限于不熟悉搜索环境中的证据收集和覆盖,还受限于证据充分性判断和何时停止决策等瓶颈。
引用
@article{arxiv.2603.04751,
title = {Evaluating the Search Agent in a Parallel World},
author = {Jiawei Chen and Xintian Shen and Lihao Zheng and Lifu Mu and Haoyi Sun and Ning Mao and Hao Ma and Tao Wei and Pan Zhou and Kun Zhan},
journal= {arXiv preprint arXiv:2603.04751},
year = {2026}
}
备注
https://github.com/TIMMY-CHAN/Mind-ParaWorld