医疗多来源检索增强生成中的源依赖性审计
计算与语言
2026-05-29 v1 人工智能
信息检索
摘要
部署在多作者机构语料库上的检索增强生成(RAG)系统会因检索来源的不同而对同一问题给出不同答案——这是主流单金标准答案范式无法诊断的失效模式。我们认为源依赖性是 NLP 评估中缺失的维度,审计它意味着将评估单位从答案正确性转向源间关系。我们在移植患者教育场景下具体化了这一观点,发布了三个实践成果:TransplantQA——真实患者提问基准,每个问题都基于多个机构手册作为候选来源生成答案;HERO-QA——一种分层检索策略,为每个答案进行依据 grounding 与审计;以及一个结构化输出评判器,基于经验证实的 5 标签分类体系对源间关系进行评分。大规模评估中,更优的检索揭示了远超先前估计的 disagreement 量——这更低估了其发生频率,而非强度。该框架具有域中性,可迁移至法律与教育 RAG 场景:度量源依赖性是部署多来源 NLP 的责任所在。
引用
@article{arxiv.2605.29084,
title = {Same Question, Different Source, Different Answer: Auditing Source-Dependence in Medical Multi-Source RAG},
author = {Yubo Li and Rema Padman and Ramayya Krishnan},
journal= {arXiv preprint arXiv:2605.29084},
year = {2026}
}