研究检索增强生成系统在不可回答、不可作弊、真实、多跳查询上的表现
计算与语言
2026-01-15 v3 信息检索
摘要
现实场景中常常向 RAG 系统提出复杂查询,这些查询的相关信息在语料库中缺失或不完整。在这些场景下,RAG 系统必须能够拒绝不可回答、超出范围的查询,并识别检索与多跳推理的失败。尽管如此,现有的 RAG 基准测试很少反映多跳或超出范围问题的真实任务复杂度,这些问题往往可以通过不连贯的推理来"作弊"(即无需真正的多跳推理即可解决),或仅需简单的事实回忆即可作答。这限制了此类基准测试揭示现有 RAG 系统局限性的能力。为弥补这一空白,我们提出了首个用于自动、可控难度地构建不可\underline{c}作弊、\underline{r}真实、\underline{u}不可回答且\underline{m}多跳\underline{q}查询(CRUMQs)的流水线,可适配任何语料库和领域。我们使用该流水线在两个流行的 RAG 数据集上构建了 CRUMQs,并通过对主流检索增强大语言模型的基准实验证明了其有效性。结果表明,与先前的 RAG 基准相比,CRUMQs 对 RAG 系统极具挑战性,可作弊性评分最高降低 81.0%。更广泛地说,我们的流水线提供了一种简单的方式来提升基准难度,并推动开发更强大的 RAG 系统。
引用
@article{arxiv.2510.11956,
title = {Investigating Retrieval-Augmented Generation Systems on Unanswerable, Uncheatable, Realistic, Multi-hop Queries},
author = {Gabrielle Kaili-May Liu and Bryan Li and Arman Cohan and William Gantt Walden and Eugene Yang},
journal= {arXiv preprint arXiv:2510.11956},
year = {2026}
}
备注
ECIR 2026