概念增强的多模态 RAG:面向可解释且准确的放射科报告生成
计算机视觉与模式识别
2026-02-18 v1
摘要
通过视觉语言模型 (VLM) 的放射科报告生成 (RRG) 旨在减轻文档负担,提高报告一致性,并加速临床工作流程。然而,其临床采用受限于可解释性不足以及倾向于生成与影像证据不符的幻觉发现。现有研究通常将可解释性和准确性视为独立目标,通过概念基于解释技术专注于透明度,而通过检索增强生成 (RAG) 方法通过外部检索实现事实 grounding。我们提出概念增强的多模态 RAG (CEMRAG),一个统一框架,将视觉表示分解为可解释的临床概念并将其与多模态 RAG 集成。该方法利用丰富的上下文提示提高 RRG 的可解释性和事实准确性。实验在 MIMIC-CXR 和 IU X-Ray 上进行,涵盖多个 VLM 架构、训练 regime 和检索配置,结果在临床准确性指标和标准 NLP 测度上均显著优于常规 RAG 和概念-only 基线。这些结果挑战了可解释性与性能之间被假定的权衡,表明透明的视觉概念不仅不损害诊断准确性,反而在医学 VLM 中提升诊断准确性。我们的模块化设计将可解释性分解为视觉透明度和结构化语言模型条件,为实现临床可信赖的 AI 辅助放射科提供了原则性路径。
引用
@article{arxiv.2602.15650,
title = {Concept-Enhanced Multimodal RAG: Towards Interpretable and Accurate Radiology Report Generation},
author = {Marco Salmè and Federico Siciliano and Fabrizio Silvestri and Paolo Soda and Rosa Sicilia and Valerio Guarrasi},
journal= {arXiv preprint arXiv:2602.15650},
year = {2026}
}