RetFiner:面向视网膜基础模型的视觉语言精炼方案
计算机视觉与模式识别
2025-06-30 v1
摘要
光学相干断层扫描(OCT)等成像技术的兴起以及深度学习(DL)的进步,使临床医生和研究人员能够简化视网膜疾病分期。一种流行的DL方法是自监督学习(SSL),模型从大量无标签数据中学习,避免了昂贵的标注。SSL促进了基础模型(FM)的发展,这些大型模型可用于各种下游任务。然而,现有的仅基于图像数据训练的OCT基础模型缺乏对图像的全面且稳健的语义理解,其下游性能(尤其是在复杂任务上)证明了这一点,因此需要监督微调(这可能不可行)以更好地适应特定应用和人群。为了解决这个问题,我们提出了RetFiner,一种自监督视觉语言精炼方案,该方案改进了现有基础模型的表示,使其能够高效、直接地适应特定人群,从而提高下游性能。我们的方法利用了一组多样化的训练目标,这些目标利用了文本数据中丰富的监督信号。我们在视网膜基础模型RETFound、UrFound和VisionFM上测试了RetFiner,在七个高度多样化的OCT分类任务上,线性探测性能显著提升,分别比基线平均提高了5.8、3.9和2.1个百分点。我们的代码和模型权重可在https://github.com/ronnief1/RetFiner公开获取。
引用
@article{arxiv.2506.22149,
title = {RetFiner: A Vision-Language Refinement Scheme for Retinal Foundation Models},
author = {Ronald Fecso and José Morano and Ursula Schmidt-Erfurth and Hrvoje Bogunović},
journal= {arXiv preprint arXiv:2506.22149},
year = {2025}
}
备注
Accepted for presentation at MICCAI 2025