中文

RAD:面向可信赖的检索增强多模态临床诊断

机器学习 2025-12-12 v2

摘要

临床诊断是一门高度专业化的学科,需要专业领域知识和严格遵守严格的指南。虽然当前AI驱动的医学研究主要关注知识图谱或自然语言文本预训练范式来整合医学知识,但这些方法主要依赖模型参数中隐式编码的知识,忽略了不同下游任务所需的任务特定知识。为了解决这一局限性,我们提出了检索增强诊断(RAD),一个将外部知识显式注入多模态模型并直接应用于下游任务的新型框架。具体而言,RAD通过三个关键机制运作:从多个医学来源检索和精炼疾病中心知识;一种指南增强的对比损失,约束多模态特征与指南知识之间的潜在距离;以及双Transformer解码器,利用指南作为查询来引导跨模态融合,使模型与从指南获取到特征提取和决策的临床诊断工作流程对齐。此外,认识到多模态诊断模型可解释性的定量评估缺乏,我们引入了一套从图像和文本两个角度评估可解释性的标准。在四个不同解剖结构的数据集上的广泛评估证明了RAD的泛化能力,达到了最先进的性能。此外,RAD使模型能够更精确地聚焦于异常区域和关键指标,确保基于证据的可信赖诊断。我们的代码可在https://github.com/tdlhl/RAD获取。

关键词

引用

@article{arxiv.2509.19980,
  title  = {RAD: Towards Trustworthy Retrieval-Augmented Multi-modal Clinical Diagnosis},
  author = {Haolin Li and Tianjie Dai and Zhe Chen and Siyuan Du and Jiangchao Yao and Ya Zhang and Yanfeng Wang},
  journal= {arXiv preprint arXiv:2509.19980},
  year   = {2025}
}

备注

Accepted to NeurIPS 2025