LiveNewsBench:基于新鲜 curated 新闻评估 LLM 网页搜索能力
信息检索
2026-02-17 v1 计算与语言
机器学习
摘要
具备代理式网页搜索能力的大语言模型(LLM)在需要实时信息获取和复杂事实检索的任务中显示出强大的潜力,但评估这类系统仍富有挑战性。我们提出\bench,一套严格且持续更新的基准,旨�评估LLM的代理式网页搜索能力。\bench自动从近期新闻文章生成新鲜问答对,确保问题超出LLM训练数据范围,从而实现内部知识与搜索能力的清晰分离。基准包含需进行多跳搜索、网页访问和推理的刻意困难问题,非常适合评估代理式搜索行为。我们的自动化数据 curatation 和 question generation 管道支持频繁更新基准,并可构建大规模的代理式网页搜索模型训练数据集,弥补该领域研究社区数据稀缺的不足。为确保可靠评估,我们在测试集中包含一部分人工验证样本。我们使用\bench对广泛的系统进行评估,包括商业和开源权重 LLM 以及 LLM 基于网页搜索的 API。积分榜、数据集和代码均已公开于livenewsbench.com。
引用
@article{arxiv.2602.13543,
title = {LiveNewsBench: Evaluating LLM Web Search Capabilities with Freshly Curated News},
author = {Yunfan Zhang and Kathleen McKeown and Smaranda Muresan},
journal= {arXiv preprint arXiv:2602.13543},
year = {2026}
}
备注
An earlier version of this work was publicly available on OpenReview as an ICLR 2026 submission in September 2025