基于图知识的视觉语言模型微调用于可解释医学图像分析
计算机视觉与模式识别
2025-09-19 v2 人工智能
摘要
糖尿病视网膜病变(DR)的准确分期对于指导及时干预和防止视力丧失至关重要。然而,当前的分期模型几乎不可解释,大多数公共数据集除了图像级标签外不包含任何临床推理或解释。在本文中,我们提出了一种将图表示学习与视觉语言模型(VLMs)相结合的新方法,以提供可解释的 DR 诊断。我们的方法利用光学相干断层扫描血管造影(OCTA)图像,构建编码关键视网膜血管特征(如血管形态和空间连接性)的生物学信息图。图神经网络(GNN)随后执行 DR 分期,同时积分梯度突出显示关键节点和边及其驱动分类决策的个体特征。我们收集这些基于图的知识,将模型的预测归因于生理结构及其特征。然后将其转换为文本描述以供 VLMs 使用。我们使用这些文本描述和相应图像进行指令微调,以训练学生 VLM。该最终智能体可以仅基于单张图像输入对疾病进行分类并以人类可解释的方式解释其决策。在专有和公共数据集上的实验评估表明,我们的方法不仅提高了分类准确性,还提供了更具临床可解释性的结果。专家研究进一步表明,我们的方法提供了更准确的诊断解释,并为在 OCTA 图像中精确定位病理开辟了道路。
引用
@article{arxiv.2503.09808,
title = {Fine-tuning Vision Language Models with Graph-based Knowledge for Explainable Medical Image Analysis},
author = {Chenjun Li and Laurin Lux and Alexander H. Berger and Martin J. Menten and Mert R. Sabuncu and Johannes C. Paetzold},
journal= {arXiv preprint arXiv:2503.09808},
year = {2025}
}
备注
11 pages, 3 figures