MedRAGChecker:面向生物医学检索增强生成的声明级验证
计算与语言
2026-01-13 v1
摘要
生物医学检索增强生成(RAG)可以将大语言模型的回答锚定在医学文献中,然而长文本输出中常常包含孤立的、缺乏支持或相互矛盾的声明,这带来了安全隐患。我们提出了 MedRAGChecker,一个面向生物医学 RAG 的声明级验证与诊断框架。给定一个问题、检索到的证据以及生成的回答,MedRAGChecker 将回答分解为原子声明,并通过结合基于证据的自然语言推理(NLI)与生物医学知识图谱(KG)一致性信号来评估声明的支持度。聚合声明决策可产生回答级别的诊断结果,有助于厘清检索与生成阶段的失败原因,包括忠实度、证据不足、矛盾以及安全关键错误率。为了实现可扩展的评估,我们将该流程蒸馏为紧凑的生物医学模型,并使用一个具有类别特定可靠性加权的集成验证器。在四个生物医学问答基准上的实验表明,MedRAGChecker 能够可靠地标记出缺乏支持和矛盾的声明,并揭示不同生成器之间的不同风险特征,尤其是在安全关键的生物医学关系方面。
引用
@article{arxiv.2601.06519,
title = {MedRAGChecker: Claim-Level Verification for Biomedical Retrieval-Augmented Generation},
author = {Yuelyu Ji and Min Gu Kwak and Hang Zhang and Xizhi Wu and Chenyu Li and Yanshan Wang},
journal= {arXiv preprint arXiv:2601.06519},
year = {2026}
}