中文

重新思考ViT自蒸馏中的随机掩码

计算机视觉与模式识别 2025-09-11 v3

摘要

Vision Transformer(ViT)在广泛视觉任务中展现了显著性能。特别是,DINO等自蒸馏框架为这些进展做出了重要贡献。在这些框架中,随机掩码常被用于提高训练效率和引入正则化。然而,最近的研究提出了担忧,即不加区分的随机掩码可能意外消除关键的语义信息,这促使了更有信息的掩码策略的发展。在本研究中,我们探讨了随机掩码在自蒸馏设置中的作用,重点关注DINO框架。具体而言,我们仅对学生的全局视图应用随机掩码,同时保持学生的局部视图和教师的全局视图以原始未掩码形式。这种设计利用了DINO的多视图增强方案,在保留干净监督信号的同时通过掩码输入引入鲁棒性。我们在mini-ImageNet数据集上使用DINO-Tiny评估了我们的方法,并证明了在这种非对称设置下的随机掩码能够产生更鲁棒和更精细的注意力图,最终增强了下游性能。

关键词

引用

@article{arxiv.2506.10582,
  title  = {Rethinking Random Masking in Self-Distillation on ViT},
  author = {Jihyeon Seong and Hyunkyung Han},
  journal= {arXiv preprint arXiv:2506.10582},
  year   = {2025}
}

备注

4 pages