中文

EyeCLIP:用于多模态眼科图像分析的视觉语言基础模型

计算机视觉与模式识别 2024-09-12 v2 人工智能

摘要

早期检测眼部疾病如青光眼、黄斑变性和糖尿病性视网膜病变对于预防视力丧失至关重要。尽管人工智能(AI)基础模型在解决此类挑战方面具有巨大潜力,但现有眼科基础模型主要关注单一模态,而诊断眼部疾病需要多模态。一个关键且常被忽视的方面是利用来自同一患者不同模态之间的数据。此外,由于眼科疾病呈长尾分布,标准的完全监督或无监督学习方法往往难以应对。因此,必须整合临床文本以捕获更广泛的疾病谱系。我们提出EyeCLIP,这是一个利用超过277万张多模态眼科图像(含部分文本数据)开发的视觉语言基础模型。为充分利用大规模多模态无标签和有标签数据,我们引入了一种预训练策略,结合自监督重建、多模态图像对比学习和图像-文本对比学习,以学习多个模态的共享表征。通过在14个基准数据集上的评估,EyeCLIP可被迁移到涉及眼部和全身疾病的广泛下游任务中,在疾病分类、视觉问答和跨模态检索中实现最先进性能。EyeCLIP代表了前一种方法的重大进步,尤其在现实世界的长尾场景中展现出零样本甚至少样本能力。

关键词

引用

@article{arxiv.2409.06644,
  title  = {EyeCLIP: A visual-language foundation model for multi-modal ophthalmic image analysis},
  author = {Danli Shi and Weiyi Zhang and Jiancheng Yang and Siyu Huang and Xiaolan Chen and Mayinuer Yusufu and Kai Jin and Shan Lin and Shunming Liu and Qing Zhang and Mingguang He},
  journal= {arXiv preprint arXiv:2409.06644},
  year   = {2024}
}