中文

基于局部掩码重建的高效自监督视觉预训练

计算机视觉与模式识别 2025-03-25 v3

摘要

计算机视觉的自监督学习取得了巨大进展,并改进了许多下游视觉任务,如图像分类、语义分割和物体检测。其中,MAE 和 BEiT 等生成式自监督视觉学习方法展现出良好性能。然而,它们的全局掩码重建机制计算开销大。为解决此问题,我们提出局部掩码重建(LoMaR),一种简单而有效的方法,在 7×\times7 图像块的小窗口内对简单 Transformer 编码器进行掩码重建,与整图全局掩码重建相比,改善了效率与精度之间的权衡。大量实验表明,LoMaR 在 ImageNet-1K 分类上达到 84.1% 的 top-1 准确率,比 MAE 高 0.5%。在 384×\times384 图像上微调预训练的 LoMaR 后,其 top-1 准确率可达 85.4%,超越 MAE 0.6%。在 MS COCO 上,LoMaR 在物体检测上以 0.5 APbox\text{AP}^\text{box} 优于 MAE,在实例分割上以 0.5 APmask\text{AP}^\text{mask} 优于 MAE。LoMaR 在预训练高分辨率图像时尤其计算高效,例如在 448×\times448 图像预训练时比 MAE 快 3.1×\times 且分类准确率高 0.2%。该局部掩码重建学习机制可轻松集成到任何其他生成式自监督学习方法中。我们的代码已公开于 https://github.com/junchen14/LoMaR。

关键词

引用

@article{arxiv.2206.00790,
  title  = {Efficient Self-supervised Vision Pretraining with Local Masked Reconstruction},
  author = {Jun Chen and Ming Hu and Boyang Li and Mohamed Elhoseiny},
  journal= {arXiv preprint arXiv:2206.00790},
  year   = {2025}
}

备注

updated version for the WACV