中文

理解视觉基础模型的迁移极限

计算机视觉与模式识别 2026-01-23 v1 人工智能

摘要

基础模型利用大规模预训练来获取广泛知识,在众多语言任务中展现出泛化能力。相比之下,尽管投入了大量计算资源,视觉基础模型在下游任务上的提升往往不均衡。我们推测,这种局限性源于预训练目标与下游视觉和成像任务需求之间的不匹配。诸如掩码图像重建或对比学习等预训练策略,会为恢复通用视觉模式或全局语义结构等任务塑造表征,这可能与包括分割、分类或图像合成在内的下游应用的特定任务需求不一致。为了在一个具体的真实世界临床领域研究这一问题,我们评估了两个视觉基础模型,一个是以重建为中心的基于 MAE 的模型(ProFound)和一个基于对比学习的模型(ProViCNet),在五个前列腺多参数 MR 成像任务上的表现,考察这种任务对齐如何影响从预训练到微调的迁移性能。我们的发现表明,预训练和下游任务之间更好的对齐(通过简单的散度度量如微调前后相同特征之间的最大均值差异来衡量)与更大的性能提升和更快的收敛速度相关,这强调了在设计预训练目标时考虑下游适用性的重要性。

关键词

引用

@article{arxiv.2601.15888,
  title  = {Understanding the Transfer Limits of Vision Foundation Models},
  author = {Shiqi Huang and Yipei Wang and Natasha Thorley and Alexander Ng and Shaheer Saeed and Mark Emberton and Shonit Punwani and Veeru Kasivisvanathan and Dean Barratt and Daniel Alexander and Yipeng Hu},
  journal= {arXiv preprint arXiv:2601.15888},
  year   = {2026}
}

备注

accepted in ISBI 2026