中文

细察自监督轻量级视觉Transformer

计算机视觉与模式识别 2023-05-04 v2

摘要

基于大规模视觉Transformer(ViTs)的自监督学习作为预训练方法已取得令人瞩目的下游性能。然而,这些预训练范式能在多大程度上提升轻量级ViT的性能,却鲜有研究。在本工作中,我们开发并在图像分类任务及若干下游密集预测任务上基准测试了多种自监督预训练方法。我们惊讶地发现,若采用恰当的预训练,即便是原始的轻量级ViT也能展现出与先前具有精巧架构设计的SOTA网络相当的性能。这打破了近期流行的“原始ViT不适用于轻量级视觉任务”的观念。我们也指出了此类预训练的一些缺陷,例如无法从大规模预训练数据中获益,以及在数据不足的下游任务上表现欠佳。此外,我们通过分析相关模型的层表示与注意力图性质,清晰揭示了此类预训练的效果。最后,基于上述分析,我们提出了一种预训练期间的蒸馏策略,进一步提升了基于MAE的预训练的下游性能。代码见 https://github.com/wangsr126/mae-lite。

关键词

引用

@article{arxiv.2205.14443,
  title  = {A Closer Look at Self-Supervised Lightweight Vision Transformers},
  author = {Shaoru Wang and Jin Gao and Zeming Li and Xiaoqin Zhang and Weiming Hu},
  journal= {arXiv preprint arXiv:2205.14443},
  year   = {2023}
}

备注

Accepted by ICML 2023