检索-推理沙盒:解耦检索与推理能力的基准
人工智能
2026-02-02 v2
摘要
尽管现有基准显示出强大的表现,但大型语言模型是否能对真正新颖的科学信息进行推理仍不明确。大多数评估对 RAG 流水线进行端到端评分,其中推理与检索和工具链选择混合,且信号进一步受到参数记忆和开放网络波动的污染。我们引入 DeR2,一个受控的深度研究沙盒,在保持深层搜索核心难度的同时隔离文件 grounding 推理:包括多步骤综合、去噪和基于证据的结论生成。DeR2 通过四个 regime 解耦证据获取与推理——仅指令、概念(带金标准概念而无文档)、仅相关(仅相关文档)和全集(相关文档加主题相关干扰项)——产生可解释的 regime 差距,量化检索损失与推理损失,实现细粒度错误归因。为防止参数泄漏,我们采用两阶段验证:要求在无证据时参数失败,确保金标准概念可解。为确保可重复性,每个实例提供来自 2023-2025 年理论论文的数据库,配有专家标注概念和验证后的理由。跨 diverse 的一系列最新基础模型实验揭示了显著的差异和显著的提升空间:一些模型表现出模式切换脆弱性,在全集情境下比仅指令情境表现更差,而另一些模型则显示结构性概念误用,正确命名概念但未按程序执行。
引用
@article{arxiv.2601.21937,
title = {Retrieval-Infused Reasoning Sandbox: A Benchmark for Decoupling Retrieval and Reasoning Capabilities},
author = {Shuangshuang Ying and Zheyu Wang and Yunjian Peng and Jin Chen and Yuhao Wu and Hongbin Lin and Dingyu He and Siyi Liu and Gengchen Yu and YinZhu Piao and Yuchen Wu and Xin Gui and Zhongyuan Peng and Xin Li and Xeron Du and Libo Qin and YiXin Cao and Ge Zhang and Stephen Huang},
journal= {arXiv preprint arXiv:2601.21937},
year = {2026}
}