基于 Few-Shot 适应和 OCT 学习的四象限分割 VLM 及其用于糖尿病视网膜病变的解释性方法
计算机视觉与模式识别
2025-12-30 v1
摘要
糖尿病视网膜病变 (DR) 是全球视力损失的主要原因,需及早检测以 preserved sight。医生资源有限,往往导致 DR 未被诊断。为此,AI 模型利用病灶分割实现可解释性;但手动标注病灶对医生而言不切实际。医生需要的模型不仅要解释分类推理,还要高亮病灶位置。此外,当前模型是一维的,仅依赖单一成像模态实现可解释性,效果有限。相比之下,识别自然语言中 individual DR 病灶的定量检测系统将克服这些限制,为筛查、治疗和科研场景提供多样化应用。为此,本文提出一种新型多模态可解释模型,利用 VLM 进行 Few-Shot 学习,模拟眼科医生的推理方式,通过分析黄豆图像中病灶在四象限内的分布来实现 fundus 图像的分割。该模型生成配对的 Grad-CAM 热力图,展示 OCT 与 fundus 图像中 individual neuron 权重,直观地突出了贡献 DR 严重程度分类的区域。本研究基于 3000 张眼底图像和 1000 张 OCT 图像,创新方法解决了当前 DR 诊断中的关键局限,为改善患者预后提供了实用且全面的工具。
引用
@article{arxiv.2512.22197,
title = {Quadrant Segmentation VLM with Few-Shot Adaptation and OCT Learning-based Explainability Methods for Diabetic Retinopathy},
author = {Shivum Telang},
journal= {arXiv preprint arXiv:2512.22197},
year = {2025}
}
备注
4 pages, 6 figures