相关性不构成依据:来自 Cited RAG 的证据-力度校准证据
人工智能
2026-05-28 v1
摘要
Cited RAG 评估常将可见来源视为依据信号,但实际上具主题相关性的引用仍可能无法对附加的表述提供充分的依据。我们研究了这一诊断性失效,称为 citation laundering:将相关来源呈现为对过度强声称的依据。我们引入 FORCEBENCH,这是一个用于证据-力度校准的对比压力测试。每个项目固定一个已引用的片段,同时在五个操作轴上:关系、情态、范围、时间有效性和数值特异性方面,将证据-校准后的声称与局部力度提升的变体配对。校准的评估者应对证据-校准后的声称给予更高的评分。headline 实验使用固定的、局部过滤后的 198 对评估集进行。按设计,引用-存在的合理性检查是无信息的;标记和实体重叠仍在 32.8--36.4% 的配对对单调性造成违反。对于四个报告的模型评估者,标准的通用支持提示对这一力度-校准压力测试不够(aggregate MVR 47.2%),而显式的依据-力度提示将 MVR 降至 24.5%但仍不完美。我们发布了基准、提示、输出和插拨式管道,使 citation 评估者能够报告单调性违反率和力度灵敏度,而不仅仅是传统支持指标。
关键词
引用
@article{arxiv.2605.28044,
title = {Relevant Is Not Warranted: Evidence-Force Calibration for Cited RAG},
author = {Pin Qian and Su Wang and Xiaoyuan Wang and Yihang Chen and Wenxuan Xu and Qiaolin Yu and Shuhuai Lin and Sipeng Zhang and Junxian You and Xinpeng Wei},
journal= {arXiv preprint arXiv:2605.28044},
year = {2026}
}