ViLReF:一种专家知识赋能的视觉-语言视网膜基础模型
计算机视觉与模式识别
2025-09-23 v4
摘要
视网膜图像和文本数据中的细微语义差异为视觉-语言模型的预训练带来了巨大挑战。此外,假阴性样本(即具有相同语义但被错误地视为负样本的图像-文本对)会破坏视觉-语言预训练过程,影响模型的学习能力。本工作旨在通过在一组包含 451,956 张视网膜图像及其对应诊断文本报告的数据集上进行预训练,开发一种名为 ViLReF 的视网膜基础模型。在我们的视觉-语言预训练策略中,我们利用专家知识来辅助标签提取,并提出一种新的约束——加权相似性耦合损失(Weighted Similarity Coupling Loss),用于在特征空间中动态调整将样本对推开的速度。此外,我们采用由动量编码器维护的带有动态内存队列的批次扩展模块,以提供额外样本并补偿因消除假阴性样本而产生的空缺。我们在多个数据集上进行了广泛的下游分类和分割任务实验。实验结果验证了 ViLReF 强大的零样本和迁移学习能力,证明了我们预训练策略的有效性。我们的 ViLReF 模型可在以下网址获取:https://github.com/T6Yang/ViLReF。
引用
@article{arxiv.2408.10894,
title = {ViLReF: An Expert Knowledge Enabled Vision-Language Retinal Foundation Model},
author = {Shengzhu Yang and Jiawei Du and Jia Guo and Weihang Zhang and Hanruo Liu and Huiqi Li and Ningli Wang},
journal= {arXiv preprint arXiv:2408.10894},
year = {2025}
}