基于增量成像模态的连续性视觉语言视网膜预训练框架
计算机视觉与模式识别
2025-06-25 v1
摘要
传统的视网膜图像分析模型专注于单模态任务,忽视了视网膜模态的互补性,这限制了其应用的灵活性。最近涌现出视网膜基础模型,但大多数模型仍局限于特定模态。将多种视网膜成像模态整合到单个基础模型中具有重要价值。然而,在动态环境中,来自不同模态的数据往往以增量方式到达,这 necessitating 持续预训练。为此,我们提出了 RetCoP——首个视网膜领域的连续性视觉语言预训练框架,该框架逐步将来自不同成像模态的图像和文本特征整合到单个统一的基础模型中。为缓解持续预训练中的灾难性遗忘,我们引入了一种利用代表性图像-文本对的重 rehearsal 策略,以及一种离对角信息蒸馏方法。前者允许模型回顾各阶段的知识,而后者显式地保留了图像与文本表示之间的对齐。实验表明,RetCoP 在所有比较方法中均表现优异,实现了最佳的泛化能力和最低的遗忘率。代码可在 https://github.com/Yuang-Yao/RetCoP 查看。
引用
@article{arxiv.2506.19320,
title = {Continual Retinal Vision-Language Pre-training upon Incremental Imaging Modalities},
author = {Yuang Yao and Ruiqi Wu and Yi Zhou and Tao Zhou},
journal= {arXiv preprint arXiv:2506.19320},
year = {2025}
}
备注
Accepted by MICCAI 2025