中文

面向选择性检索增强生成的充分性与不确定性感知证据验证——SURE-RAG

计算与语言 2026-05-06 v1 信息检索 机器学习

摘要

检索增强生成(RAG)将检索到的段落作为答案依据,但检索并不等同于验证:一个段落可能在主题上相关,却无法为答案提供依据。我们将这一鸿沟表述为针对选择性RAG答案的证据充分性验证:给定问题、候选答案和检索证据,预测证据是否支持、反驳或不足,并在仅当确认支持时才作出回答。我们提出SURE-RAG,一种基于证据充分性是集合级属性这一观察的透明聚合协议:缺失的跳跃和未解决的冲突无法通过独立的段落评分来检测。一个共享的两级称-证据验证器产生局部关系分布,SURE-RAG将其聚合为可解释的答案级信号——覆盖范围、关系强度、 disagreement、冲突和检索不确定性——从而实现三向决策并生成可审计的选择性得分。我们在HotpotQA-RAG v3上进行评估,该数据集是一个受控的多跳基准,在 artifact-aware 协议下进行(shortcut基线、反事实置换、无oracle检查、GPT-4o审计)。校准后的SURE-RAG达到0.9075的宏平均F1(0.8951 ± 0.0069),显著高于DeBERTa平均池化(0.6516)和GPT-4o裁判(0.7284),同时与一个强大但不透明的concat cross-encoder(0.8888 ± 0.0109)相当,并实现了完整的可审计性。在30%的覆盖率下,风险从0.2588降至0.1642,约37%的unsafe答案被减少。为刻意探索任务边界,我们进一步将SURE-RAG与GPT-4o在HaluBench unsafe 检测上进行比较:排名反转(0.3343 vs 0.7389 unsafe-F1),确立了受控的充分性验证与自然幻觉检测是不同问题。

关键词

引用

@article{arxiv.2605.03534,
  title  = {SURE-RAG: Sufficiency and Uncertainty-Aware Evidence Verification for Selective Retrieval-Augmented Generation},
  author = {Jingxi Qiu and Zeyu Han and Cheng Huang},
  journal= {arXiv preprint arXiv:2605.03534},
  year   = {2026}
}

备注

8 pages, 2 figures, 8 tables. Submitted to IEEE PRAI 2026