探索通过掩码图像建模预训练实现强轻量级视觉Transformer的实验研究
计算机视觉与模式识别
2024-05-28 v2
摘要
大规模视觉Transformer(ViT)的掩码图像建模(MIM)预训练使得在学习的自监督ViT特征之上实现了有希望的下游性能。在本文中,我们质疑是否这种预训练范式也能使极其简单的轻量级ViT的微调性能受益,这与成熟的轻量级架构设计方法论相比,研究得少得多。我们采用观察-分析-解决方案流程进行研究。我们首先系统地观察了评估的预训练方法在下游微调数据规模方面的不同行为。此外,我们分析了获得模型的层表示相似性和注意力图,这清楚地显示了MIM预训练在较高层上的学习较差,导致在数据不足的下游任务上迁移性能不理想。这一发现自然指导我们在预训练期间设计蒸馏策略以解决上述退化问题。大量实验证明了我们方法的有效性。我们在纯轻量级ViT(vanilla/hierarchical设计,5.7M/6.5M参数)上的预训练加蒸馏在ImageNet-1K上达到了79.4%/78.9%的top-1准确率。它还在轻量级领域实现了ADE20K分割任务(42.8% mIoU)和LaSOT跟踪任务(66.1% AUC)的SOTA性能。后者甚至超过了所有当前SOTA轻量级CPU实时跟踪器。
引用
@article{arxiv.2404.12210,
title = {An Experimental Study on Exploring Strong Lightweight Vision Transformers via Masked Image Modeling Pre-Training},
author = {Jin Gao and Shubo Lin and Shaoru Wang and Yutong Kou and Zeming Li and Liang Li and Congxuan Zhang and Xiaoqin Zhang and Yizheng Wang and Weiming Hu},
journal= {arXiv preprint arXiv:2404.12210},
year = {2024}
}
备注
A submission to IJCV