中文

无排序RAG:在敏感领域用选择替代RAG中的重排序

计算与语言 2026-01-21 v4

摘要

在敏感领域,检索增强生成(RAG)必须是可解释且鲁棒的,因为错误不仅会误导,还会招致诉讼、损害学术信誉并违反合规要求。利益相关者需要可追溯的证据、为何选择特定证据的清晰理由,以及针对被污染或误导性内容的防护措施。然而,当前的RAG流程依赖于基于相似性的检索,采用任意的top-k截断,不提供选择解释,并且容易受到污染攻击。我们提出METEORA,用基于理由驱动的选择来替代这些缺陷,使用显式推理来指导证据选择、解释决策并提高对RAG污染的鲁棒性。METEORA分三个阶段运行:(1)使用直接偏好优化对通用LLM进行偏好微调,以生成以查询为条件的理由;(2)这些理由驱动一个证据块选择引擎,将理由与检索到的证据配对以实现查询特定的相关性,并应用肘部检测来选择自适应截断(可选地通过相邻块扩展上下文);(3)验证器LLM使用这些理由在生成前检测并过滤被污染或误导性的证据。在六个数据集上,METEORA的召回率提高了13.41%,在不扩展的情况下,精确率比最强基线提高了21.05%。它将达到可比召回率所需的证据减少了80%,将下游答案准确率提高了33.34%,并通过将F1分数从0.10提高到0.44来增强对抗防御能力。代码可在以下地址获取:https://anonymous.4open.science/r/METEORA-DC46/README.md

关键词

引用

@article{arxiv.2505.16014,
  title  = {Ranking Free RAG: Replacing Re-ranking with Selection in RAG for Sensitive Domains},
  author = {Yash Saxena and Ankur Padia and Mandar S Chaudhary and Kalpa Gunaratna and Srinivasan Parthasarathy and Manas Gaur},
  journal= {arXiv preprint arXiv:2505.16014},
  year   = {2026}
}