中文

基于知识增强的多模态Transformer用于糖尿病视网膜病变诊断中的跨模态对齐

计算机视觉与模式识别 2025-12-23 v1 人工智能

摘要

糖尿病视网膜病变 (DR) 是全球可防性失明的主要原因,要求准确的自动诊断系统。虽然通用领域的视觉语言模型如对比式语言-图像预训练 (CLIP) 在自然图像任务中表现良好,但在医疗领域应用时尤其在眼科图像的跨模态检索方面仍面临挑战。我们提出一种新颖的知识增强联合嵌入框架,通过多模态Transformer架构整合视网膜 Fundus 图像、临床文本和结构化患者数据,以解决医学图像-文本对齐的关键差距。我们的方案为每种模态采用独立编码器:为视网膜图像使用视觉Transformer (ViT-B/16),为临床叙述使用 Bio-ClinicalBERT,为结构化人口学和临床特征使用多层感知器。这些模态通过带有模态特定嵌入的联合Transformer进行融合,采用包括模态对间的对比损失、图像和文本的重构损失以及根据 ICDR 和 SDRG 方案对 DR 严重程度分级的分类损失等多个目标进行训练。在巴西多标签眼科数据集 (BRSET) 上的实验结果表明,我们的框架显著优于基线模型。我们的框架在文本到图像检索中实现近乎完美的性能,Recall@1 达到 99.94%,而微调的 CLIP 仅为 1.29%;同时保持 97.05% 和 97.97% 的 SDRG 和 ICDR 分类准确率。此外,对未见数据集 DeepEyeNet 的零样本评估显示出 93.95% 的 Recall@1 相对于 0.22% 的微调 CLIP 的强大通用性。这些结果表明,我们的多模态训练方法有效地捕获了医疗领域的跨模态关系,建立了卓越的检索能力和稳健的诊断性能。

关键词

引用

@article{arxiv.2512.19663,
  title  = {Beyond CLIP: Knowledge-Enhanced Multimodal Transformers for Cross-Modal Alignment in Diabetic Retinopathy Diagnosis},
  author = {Argha Kamal Samanta and Harshika Goyal and Vasudha Joshi and Tushar Mungle and Pabitra Mitra},
  journal= {arXiv preprint arXiv:2512.19663},
  year   = {2025}
}

备注

14 pages, 14 figures