局部掩码结合渐进冻结:为自监督学习构建高效的视觉 Transformer
计算机视觉与模式识别
2023-12-06 v1
摘要
本文提出了一种用于 Vision Transformer (ViT) 自监督学习的创新方法,将局部掩码图像建模与渐进层冻结相结合。该方法侧重于提升 ViT 初始层训练的效率与速度。通过在训练过程中的关键节点系统性地冻结特定层,我们在保持或提升学习能力的同时减少了计算需求。我们的方法采用了一种新颖的多尺度重建过程,促进了初始层的高效学习,并增强了跨尺度的语义理解。结果表明,训练时间大幅减少(约 12.5\%),且对模型精度的影响极小(top-1 精度仅下降 0.6\%)。我们的方法分别达到了 82.6\% 的 top-1 精度和 96.2\% 的 top-5 精度,凸显了其在计算资源和时间受限场景下的潜力。这项工作标志着计算机视觉自监督学习领域的进步。我们方法的实现可在项目的 GitHub 仓库中找到:github.com/utkutpcgl/ViTFreeze。
引用
@article{arxiv.2312.02194,
title = {Local Masking Meets Progressive Freezing: Crafting Efficient Vision Transformers for Self-Supervised Learning},
author = {Utku Mert Topcuoglu and Erdem Akagündüz},
journal= {arXiv preprint arXiv:2312.02194},
year = {2023}
}