简洁检索提升挑战性、推理密集型基准测试
计算与语言
2025-07-08 v2 信息检索
摘要
检索增强生成(RAG)主要在有限设置下进行研究,如事实性问答;而对更具挑战性、推理密集型基准测试,最小化RAG的效果有限。本文挑战了此先验观点,针对MMLU、MMLU Pro、AGI Eval、GPQA和MATH等 established 推理密集型基准测试展开研究。我们识别出先前工作中的关键缺失环节:与预训练数据范围对齐的可用、网络规模数据存储库。为此,我们引入CompactDS:一个多样化、高质量、网络规模数据存储库,实现对单节点上的高检索准确率和亚秒延迟。关键洞察包括:(1)大多数网络内容可在不牺牲覆盖率的情况下被过滤,紧凑且高质量的子集足以;(2)结合内存中近似最近邻(ANN)检索和磁盘上精确搜索,可平衡速度与召回率。使用CompactDS,我们表明,最小化RAG管道在所有基准测试和模型规模(8B--70B)上均实现一致的准确率提升,MMLU提升10%,MMLU Pro提升33%,GPQA提升14%,MATH提升19%。单一数据源无法单独满足,凸显了数据源多样性(网络爬虫、精选数学、学术论文、教科书)的重要性。最后,我们展示的 carefully 设计的内部数据存储库与Google Search等网络搜索引擎以及最近提出的复杂基于智能体的RAG系统相当或更好——同时保持简单性、可重复性和自包含性。我们发布CompactDS及检索管道,支持未来研究探索基于检索的AI系统。
引用
@article{arxiv.2507.01297,
title = {Frustratingly Simple Retrieval Improves Challenging, Reasoning-Intensive Benchmarks},
author = {Xinxi Lyu and Michael Duan and Rulin Shao and Pang Wei Koh and Sewon Min},
journal= {arXiv preprint arXiv:2507.01297},
year = {2025}
}
备注
33 pages, 2 figures, 27 tables