XDR-LVLM:一种用于糖尿病视网膜病变诊断的可解释视觉-语言大模型
计算机视觉与模式识别
2025-08-22 v1
摘要
糖尿病视网膜病变(Diabetic Retinopathy, DR)是全球失明的主要原因之一,亟需早期且准确的诊断。尽管深度学习模型在DR检测中展现出潜力,但其黑箱特性常因缺乏透明度和可解释性而阻碍临床采纳。为解决这一问题,我们提出XDR-LVLM(基于LVLM的可解释糖尿病视网膜病变诊断),这是一个利用视觉-语言大模型(Vision-Language Large Models, LVLMs)进行高精度DR诊断并辅以自然语言解释的新颖框架。XDR-LVLM集成了一个专用的医学视觉编码器、一个LVLM核心,并采用多任务提示工程和多阶段微调,以深入理解眼底图像中的病理特征并生成全面的诊断报告。这些报告明确包含DR严重程度分级、关键病理概念(如出血、渗出、微动脉瘤)的识别,以及将观察到的特征与诊断联系起来的详细解释。在糖尿病视网膜病变(DDR)数据集上的大量实验表明,XDR-LVLM达到了最先进的性能,疾病诊断的平衡准确率为84.55%,F1分数为79.92%,并且在概念检测上取得了优异结果(平衡准确率77.95%,F1分数66.88%)。此外,人工评估证实了所生成解释的高流畅性、准确性和临床实用性,展示了XDR-LVLM通过提供稳健且可解释的洞察来弥合自动化诊断与临床需求之间差距的能力。
引用
@article{arxiv.2508.15168,
title = {XDR-LVLM: An Explainable Vision-Language Large Model for Diabetic Retinopathy Diagnosis},
author = {Masato Ito and Kaito Tanaka and Keisuke Matsuda and Aya Nakayama},
journal= {arXiv preprint arXiv:2508.15168},
year = {2025}
}