语境中的矛盾:医疗检索增强生成的挑战
信息检索
2026-04-07 v2 机器学习
摘要
在医疗等高风险信息领域,大型语言模型(LLM)可能产生幻觉或错误信息,检索增强生成(RAG)被提出作为缓解措施,将模型输出 grounding 在外部、特定于领域的文档上。然而,这种方法在源文档包含过时或相互矛盾信息时会引入错误。本文研究了五种 LLM 在生成医药相关查询的 RAG-based响应中的表现。我们的贡献有三点:i) 使用澳大利亚药品评估局(TGA)的消费级医药信息文档创建基准数据集,将标题用作自然语言问题;ii) 使用TGA标题检索PubMed摘要,按多个出版年份分层,以实现对过时证据的受控评估;iii) 对过时或相互矛盾内容对模型生成响应的频率和影响进行比较分析,评估 LLM如何整合并调和时序不一致的信息。我们的发现表明,高度相似的摘要之间的矛盾确实会降低性能,导致不一致并降低模型答案的事实准确性。这些结果表明,仅凭检索相似性对于可靠的医疗 RAG 是不够的,强调了确保高风险领域可信响应所需的矛盾感知过滤策略。
引用
@article{arxiv.2511.06668,
title = {Contradictions in Context: Challenges for Retrieval-Augmented Generation in Healthcare},
author = {Saeedeh Javadi and Sara Mirabi and Manan Gangar and Bahadorreza Ofoghi},
journal= {arXiv preprint arXiv:2511.06668},
year = {2026}
}