探索掩码图像建模中频率与注意力的协同作用
计算机视觉与模式识别
2024-10-01 v3 机器学习
摘要
最近,掩码图像建模(MIM)通过重建图像的掩码块来学习视觉表征,已在计算机视觉的自监督学习中占据主导地位。然而,由于大规模数据和大尺寸骨干网络,MIM的预训练总是耗时巨大。我们主要将此归因于先前MIM工作中的随机块掩码策略,该策略未能利用关键的语义信息进行有效的视觉表征学习。为了解决这个问题,我们提出了频率与注意力驱动的掩码与丢弃策略(FAMT),该策略能够提取语义块并减少训练块的数量,从而同时提升模型性能和训练效率。具体而言,FAMT在训练期间以无监督的方式利用自注意力机制从图像中提取语义信息进行掩码。然而,仅靠注意力有时可能会聚焦于与语义信息不相关的区域。因此,我们受启发将频率域的信息融入自注意力机制,以推导用于掩码的采样权重,从而捕获用于视觉表征学习的语义块。此外,我们引入了一种基于所推导采样权重的块丢弃策略,以降低训练成本。FAMT可以作为一个即插即用的模块无缝集成,并超越先前的工作,例如,在CIFAR-10/100、Tiny ImageNet和ImageNet-1K等多个数据集上,将训练阶段时间减少近50%,并将MAE的线性探测准确率提高1.3%至3.9%。FAMT在下游检测和分割任务中也表现出卓越的性能。
引用
@article{arxiv.2211.15362,
title = {Exploring the Coordination of Frequency and Attention in Masked Image Modeling},
author = {Jie Gui and Tuo Chen and Minjing Dong and Zhengqi Liu and Hao Luo and James Tin-Yau Kwok and Yuan Yan Tang},
journal= {arXiv preprint arXiv:2211.15362},
year = {2024}
}