中文

医学问答检索增强生成的系统诊断:RAG-X

计算与语言 2026-03-05 v1 人工智能

摘要

自动问答(QA)系统越来越依赖检索增强生成(RAG)来将大型语言模型(LLM) grounding 在权威医学知识之上,以确保医疗 AI 应用中的临床准确性和患者安全。尽管在 RAG 评估方面取得了进展,当前的基准仅关注简单的多选 QA 任务,并采用无法很好捕捉复杂 QA 任务所需语义精确度的指标。这些方法无法诊断错误源于错误的检索还是有缺陷的生成,从而限制了开发人员进行有针对性的改进。为弥合这一差距,我们提出了 RAG-X,一种诊断框架,用于在三个 QA 任务上独立评估检索器和生成器:信息抽取、短答案生成和多选题(MCQ)问答。RAG-X 引入 Context Utilization Efficiency(CUE)指标,将系统成功分解为可解释的四个象限,隔离验证的 grounding 与虚假的准确性。我们的实验揭示了一条“准确性幻觉”, perceived system success 与 evidence-based grounding 之间存在 14% 的差距。通过揭示隐藏的失败模式,RAG-X 提供了诊断透明度,以实现安全可验证的临床 RAG 系统。

关键词

引用

@article{arxiv.2603.03541,
  title  = {RAG-X: Systematic Diagnosis of Retrieval-Augmented Generation for Medical Question Answering},
  author = {Aswini Sivakumar and Vijayan Sugumaran and Yao Qiang},
  journal= {arXiv preprint arXiv:2603.03541},
  year   = {2026}
}

备注

7 pages, 1 figure