中文

BrowseComp-ZH:衡量大语言模型中文网页浏览能力的基准测试

计算与语言 2025-05-02 v2

摘要

随着大语言模型(LLM)向工具使用智能体演进,实时网页浏览能力已成为衡量其推理与检索能力的关键指标。现有基准如BrowseComp主要聚焦英文,忽略了中文等其他主要信息生态系统在语言、基础设施及内容审查方面的独特复杂性。为此,我们引入BrowseComp-ZH,一个高难度基准,专为全面评估LLM在中文网页上的表现而设计。BrowseComp-ZH包含289个跨域问题,覆盖11个多样领域。每个问题都以一个简短、客观且易于验证的答案(如日期、数字或专有名词)为出发点进行逆向工程。我们采用两阶段质量控制程序,以追求高问题难度和答案唯一性。我们在BrowseComp-ZH上对20多个最先进的语言模型和agentic搜索系统进行基准测试。尽管这些模型在对话和检索方面表现强劲,但实际表现仍严重受限:大量模型准确率低于10%,仅有少数超过20%。即便是最佳表现者OpenAI的DeepResearch,仅达到42.9%。这些结果表明BrowseComp-ZH的难度相当陡峭,其成功不仅需要有效的检索策略,还需要精细的推理与信息整合能力——这些都是当前模型仍显不足的能力。我们的数据集、构建指南及基准结果已公开发布于https://github.com/PALIN2018/BrowseComp-ZH。

关键词

引用

@article{arxiv.2504.19314,
  title  = {BrowseComp-ZH: Benchmarking Web Browsing Ability of Large Language Models in Chinese},
  author = {Peilin Zhou and Bruce Leon and Xiang Ying and Can Zhang and Yifan Shao and Qichen Ye and Dading Chong and Zhiling Jin and Chenxuan Xie and Meng Cao and Yuxin Gu and Sixin Hong and Jing Ren and Jian Chen and Chao Liu and Yining Hua},
  journal= {arXiv preprint arXiv:2504.19314},
  year   = {2025}
}

备注

Under Review