中文

MM-Retinal:基于眼底图像-文本专长的知识增强基础预训练方法

计算机视觉与模式识别 2025-08-27 v1

摘要

当前眼底图像分析模型主要针对特定任务,依赖单个数据集。学习过程通常基于数据驱动范式,缺乏先验知识,导致迁�移性和可泛化性差。为此,我们提出了MM-Retinal,一个包含来自专业眼底图书收集的高质量图像-文本对的多模态数据集。此外,借助MM-Retinal,我们提出了一种新颖的知识增强基础预训练模型,称为KeepFIT,它 incorporates眼底图像-文本专长。该模型采用图像相似性引导的文本修订和混合训练策略,以注入专家知识。我们提出的眼底基础模型在六个未知下游任务上实现了最先进的性能,并在零样本和少样本场景中表现出优异的泛化能力。MM-Retinal和KeepFIT已在https://github.com/lxirich/MM-Retinal上提供。

关键词

引用

@article{arxiv.2405.11793,
  title  = {MM-Retinal: Knowledge-Enhanced Foundational Pretraining with Fundus Image-Text Expertise},
  author = {Ruiqi Wu and Chenran Zhang and Jianle Zhang and Yi Zhou and Tao Zhou and Huazhu Fu},
  journal= {arXiv preprint arXiv:2405.11793},
  year   = {2025}
}

备注

Early Accepted by The International Conference on Medical Image Computing and Computer Assisted Intervention(MICCAI)2024