中文

解构深度搜索:基于无线索提示的多跳问题及分解度量的全面评估

计算与语言 2025-12-11 v3

摘要

检索增强生成 (RAG) 系统和网页智能体正在针对多跳深度搜索任务进行评估,但当前实践存在两个主要局限:第一,大多数基准会在问题文本中泄露推理路径,使模型能够遵循表面线索而非自主发现推理链;第二,评估通常仅限于单一通过率,这会将多样化行为压缩为一个分数,掩盖失败是源于搜索不足、知识运用不当,还是不当拒绝。为解决这些问题,我们提出了 WebDetective,一个包含无线索提示的多跳问题基准,配合受控的维基百科沙盒,确保模型行为的完整可追溯性,并提出了全面的评估框架,将搜索充分性、知识运用和拒绝行为分开。我们对 25 个最先进模型的评估揭示了各类架构在所有方面都存在系统性弱点:模型在拥有足够证据的情况下仍 struggle with knowledge utilisation despite having sufficient evidence, 并在证据缺失时几乎不存在恰当的拒绝行为。这些模式暴露了一个根本性差距:当今系统擅长执行既定推理路径,但在需要自主发现路径时却失败。我们开发了 EvidenceLoop 智能体工作流程,显著针对本基准识别的挑战进行设计,包括验证循环和系统性证据跟踪,以提升搜索和综合能力。该基准测试的诊断框架指导具体的架构改进,确立了 WebDetective 作为开发真正自主推理系统而非模式跟随智能体的关键工具。

关键词

引用

@article{arxiv.2510.05137,
  title  = {Demystifying deep search: a holistic evaluation with hint-free multi-hop questions and factorised metrics},
  author = {Maojia Song and Renhang Liu and Xinyu Wang and Yong Jiang and Pengjun Xie and Fei Huang and Jingren Zhou and Dorien Herremans and Soujanya Poria},
  journal= {arXiv preprint arXiv:2510.05137},
  year   = {2025}
}