Wiki Live Challenge:挑战性的深度研究代理与专家级别维基百科文章
计算与语言
2026-02-04 v2
摘要
深度研究代理(DRAs)在自主信息检索和报告生成方面已展现出惊人的能力,显示出在复杂研究任务中帮助人类的巨大潜力。当前的评估框架主要依赖于由 LLM 生成的参考文献或 LLM 派生的评估维度。虽然这些方法具有可扩展性,但往往缺乏专家验证内容的可靠性,难以为关键维度提供客观、细粒度的评估。为弥合这一差距,我们引入 Wiki Live Challenge(WLC),这是一个实时基准,利用最新的维基百科优秀文章(Good Articles)作为专家级参考。维基百科对中立性、全面性和可核查性的严格标准为 DRAs 提供了巨大的挑战,优秀文章代表了其中期的巅峰。我们策划了 100 篇近期优秀文章的数据集,并提出 Wiki Eval 综合评估框架,包括 39 项写作质量的细粒度评估方法以及严格的事实核查性指标。对 various DRA 系统的大量实验表明,当前 DRAs 与人类专家级别的维基百科文章之间存在显著差距,验证了 WLC 在推动代理研究中的有效性。我们将在 https://github.com/WangShao2000/Wiki_Live_Challenge 上发布本基准。
引用
@article{arxiv.2602.01590,
title = {Wiki Live Challenge: Challenging Deep Research Agents with Expert-Level Wikipedia Articles},
author = {Shaohan Wang and Benfeng Xu and Licheng Zhang and Mingxuan Du and Chiwei Zhu and Xiaorui Wang and Zhendong Mao and Yongdong Zhang},
journal= {arXiv preprint arXiv:2602.01590},
year = {2026}
}
备注
Preprint