中文

释放基石视觉模型:适用于多样数据受限科学领域的自适应迁移

计算机视觉与模式识别 2025-12-30 v1 人工智能

摘要

在大数据时代,计算机视觉领域受益于如 LAION-2B、LAION-400M、ImageNet-21K、Kinetics 等大规模数据集,流行的 ViT 和 ConvNeXt 系列模型在此基础上进行预训练,获得了大量知识。然而,诸多下游任务在专业且数据受限的科学领域仍面临重大挑战。本文提出一种新型聚类注意力适配器(CLAdapter),通过分布相关性和转换矩阵,对从大规模数据中学习到的丰富表征进行细化和适配,以适应各种数据受限的下游任务。具体而言,CLAdapter 引入注意力机制和聚类中心,通过分布相关性和转换矩阵个性化地增强变换后的特征。这使得使用 CLAdapter 微调的模型能够针对不同特征集学习独特的表征,有效促进模型从丰富的预训练特征适应到各种下游场景。此外,CLAdapter 的统一接口设计允许无缝集成到包括 CNN 和 Transformer 在内的多种模型架构中,适用于 2D 和 3D 语境。通过在覆盖通用、多媒体、生物学、医学、工业、农业、环境、地理、材料科学、离群分布(OOD)以及 3D 分析等 10 个数据集上的大量实验,CLAdapter 在多样数据受限的科学领域实现了最先进的性能,展示了通过自适应迁移释放基石视觉模型潜力的有效性。代码已公开于 https://github.com/qklee-lz/CLAdapter。

关键词

引用

@article{arxiv.2512.22664,
  title  = {Unleashing Foundation Vision Models: Adaptive Transfer for Diverse Data-Limited Scientific Domains},
  author = {Qiankun Li and Feng He and Huabao Chen and Xin Ning and Kun Wang and Zengfu Wang},
  journal= {arXiv preprint arXiv:2512.22664},
  year   = {2025}
}