中文

MM-Retinal V2:将优秀知识之火传递至眼底视觉语言预训练

计算机视觉与模式识别 2025-08-26 v1

摘要

视觉语言预训练(Vision-Language Pretraining,VLP)旨在实现跨多样下游任务的泛化,用于眼底图像分析。虽然最近的方法展现出有前景的成果,但它们显著依赖大规模私人图像-文本数据,却较少关注预训练方式,这限制了进一步的发展。在本工作中,我们引入MM-Retinal V2,一个高质量的图像-文本配对数据集,包含CFP、FFA和OCT图像模态。随后,我们提出一种新型眼底视觉语言预训练模型,称为KeepFIT V2,通过将优秀数据之火的知识整合到类目化公共数据集中进行预训练。具体而言,采用初步文本预训练,使文本编码器具备主要眼科文本知识。此外,设计了一种混合图像-文本知识注入模块进行知识迁移,基于对比学习中全局语义概念与生成学习中局部外观细节的结合。广泛的实验在零样例、少样本和线性探测设置下,突出了KeepFIT V2的泛化性和可迁移性,性能与在大规模私人图像-文本数据集上训练的先进眼底VLP模型相当。我们的数据集和模型已通过https://github.com/lxirich/MM-Retinal公开。

关键词

引用

@article{arxiv.2501.15798,
  title  = {MM-Retinal V2: Transfer an Elite Knowledge Spark into Fundus Vision-Language Pretraining},
  author = {Ruiqi Wu and Na Su and Chenran Zhang and Tengfei Ma and Tao Zhou and Zhiting Cui and Nianfeng Tang and Tianyu Mao and Yi Zhou and Wen Fan and Tianxing Wu and Shenqi Jing and Huazhu Fu},
  journal= {arXiv preprint arXiv:2501.15798},
  year   = {2025}
}