中文

通过 ImageNet-1K 访问视觉基础模型

计算机视觉与模式识别 2025-02-12 v2 人工智能 机器学习

摘要

视觉基础模型因大规模训练数据而闻名于泛化能力。然而,它们需要巨大的训练资源,而且训练数据往往不可获取,例如 CLIP、DINOv2,这给开发能够促进研究的衍生模型带来了很大的挑战。本文提出一种非常简单且通用的解决方案,名为 \textit{Proteus},通过在 ImageNet-1K 上蒸馏基础模型于较小的等价模型,而无需访问原始训练数据。具体而言,我们移除了常规知识蒸馏设置中导致数据偏差的设计,并提出三层次的训练目标,即 token、patch 和 feature,以最大化知识传递的效果。如此一来,Proteus 在 ImageNet 水平的训练成本下拥有惊人的能力,促进了更广泛的研究社区获取训练基础模型的能力。当以 DINOv2-g/14 作为教师时,Proteus-L/14 在 19 个基准测试上匹配了 Oracle 方法 DINOv2-L/14(1420 万训练数据),并超过了包括 CLIP-L/14(4 亿)、OpenCLIP-L/14(40 亿/200 亿)和 SynCLR-L/14(6 亿)在内的其他视觉基础模型,训练数据仅为 120 万张图像。

关键词

引用

@article{arxiv.2407.10366,
  title  = {Accessing Vision Foundation Models via ImageNet-1K},
  author = {Yitian Zhang and Xu Ma and Yue Bai and Huan Wang and Yun Fu},
  journal= {arXiv preprint arXiv:2407.10366},
  year   = {2025}
}

备注

Accepted by ICLR2025