LiveBrowseComp:搜索代理是否在搜索,还是仅在验证它们已知的内容?
人工智能
2026-05-28 v1
摘要
基于 LLM 的搜索代理是否真正进行搜索,还是仅利用 web 验证已有知识?我们在 BrowseComp 上进行分析,采用三项诊断工具。我们的分析揭示了内在知识依赖 (Intrinsic Knowledge Dependence, IKD):即便拥有工具访问权限,代理往往依赖内在知识——即模型在检索前编码的知识——而非外部证据。代理可在无工具的情况下回答最高达 44.5% 的 BrowseComp 问题,从内部产生的假设而非检索到的导线生成超过一半的搜索查询,移除答案支持证据后表现跌破封闭式基准。这些结果表明,静态搜索基准可能奖励基于记忆的验证,而非以证据驱动的发现,混淆了代理已知的内容与可检索内容。随后我们引入 LiveBrowseComp,旨在超越内在覆盖范围评估代理,包含 335 个人工编写的问题,其答案依赖于基准构建前 90 天内发布的事实,从六个更新来源中筛选,排除全球显著事件。LiveBrowseComp 上,所有评估的代理在封闭式准确率以下 2%,搜索增强得分相对于 BrowseComp 下降 25-40 分,先前模型排名不再可靠预测性能。LiveBrowseComp 已在 https://huggingface.co/datasets/Forival/LiveBrowseComp 提供。
引用
@article{arxiv.2605.28721,
title = {LiveBrowseComp: Are Search Agents Searching, or Just Verifying What They Already Know?},
author = {HuiMing Fan and Xiao Wang and Zheng Chu and Qianyu Wang and Zhuoyao Wang and Ming Liu and Bing Qin and XingYu},
journal= {arXiv preprint arXiv:2605.28721},
year = {2026}
}