PhantomWiki:用于推理与检索评估的按需数据集
机器学习
2025-06-10 v2 人工智能
计算与语言
摘要
高质量的基准数据集对于评估大型语言模型(LLM)的推理和检索能力至关重要。然而,作为解决方案,编制数据集并非永久性做法,因为它们容易导致数据泄露和性能膨胀。为此,我们提出PhantomWiki:一个生成唯一且事实一致文档语料库,包含多样化问答对的管道。不同于先前工作,PhantomWiki既不是固定数据集,也不基于任何现有数据。相反,每次评估都会按需生成新的PhantomWiki实例。我们可控问 difficulty 和语料库规模,以无缝分离推理和检索能力,发现PhantomWiki数据集对前沿LLM而言仍然具有挑战性。因此,我们贡献了一个可扩展且抗数据泄露的框架,用于分离评估推理、检索和工具使用能力。我们的代码已公开于 https://github.com/kilian-group/phantom-wiki。
引用
@article{arxiv.2502.20377,
title = {PhantomWiki: On-Demand Datasets for Reasoning and Retrieval Evaluation},
author = {Albert Gong and Kamilė Stankevičiūtė and Chao Wan and Anmol Kabra and Raphael Thesmar and Johann Lee and Julius Klenke and Carla P. Gomes and Kilian Q. Weinberger},
journal= {arXiv preprint arXiv:2502.20377},
year = {2025}
}
备注
Accepted to ICML 2025