中文

PhantomWiki:用于推理与检索评估的按需数据集

机器学习 2025-06-10 v2 人工智能 计算与语言

摘要

高质量的基准数据集对于评估大型语言模型(LLM)的推理和检索能力至关重要。然而,作为解决方案,编制数据集并非永久性做法,因为它们容易导致数据泄露和性能膨胀。为此,我们提出PhantomWiki:一个生成唯一且事实一致文档语料库,包含多样化问答对的管道。不同于先前工作,PhantomWiki既不是固定数据集,也不基于任何现有数据。相反,每次评估都会按需生成新的PhantomWiki实例。我们可控问 difficulty 和语料库规模,以无缝分离推理和检索能力,发现PhantomWiki数据集对前沿LLM而言仍然具有挑战性。因此,我们贡献了一个可扩展且抗数据泄露的框架,用于分离评估推理、检索和工具使用能力。我们的代码已公开于 https://github.com/kilian-group/phantom-wiki。

关键词

引用

@article{arxiv.2502.20377,
  title  = {PhantomWiki: On-Demand Datasets for Reasoning and Retrieval Evaluation},
  author = {Albert Gong and Kamilė Stankevičiūtė and Chao Wan and Anmol Kabra and Raphael Thesmar and Johann Lee and Julius Klenke and Carla P. Gomes and Kilian Q. Weinberger},
  journal= {arXiv preprint arXiv:2502.20377},
  year   = {2025}
}

备注

Accepted to ICML 2025