对称遮蔽策略提升遮蔽图像建模性能
计算机视觉与模式识别
2024-12-16 v2 人工智能
摘要
遮蔽图像建模 (MIM) 是自监督学习中的一种技术,旨在通过估计随机遮蔽区域中缺失的像素,从 unlabeled 图像中获取详细的视觉表征。它已被证明是 Vision Transformer (ViT) 预训练的强大工具,已在各种任务中取得惊人的成果。然而,大多数 MIM 方法严重依赖随机遮蔽策略来构建预置任务。这种策略需要大量试验以确定最佳 dropping 比例,可能需要进行 800 到 1600 个 epoch 的预训练。此外,这种方法可能不适用于所有数据集。本文提出了一种新型遮蔽策略,有效帮助模型捕获全局和局部特征。基于此遮蔽策略,引入了 SymMIM,我们提出的 MIM 训练管道。SymMIM 在使用 ViT-Large 在 ImageNet 上的准确率达到新的 SOTA 85.9%,并在图像分类、语义分割、目标检测、实例分割等下游任务中超越了之前的 SOTA。
引用
@article{arxiv.2408.12772,
title = {Symmetric masking strategy enhances the performance of Masked Image Modeling},
author = {Khanh-Binh Nguyen and Chae Jung Park},
journal= {arXiv preprint arXiv:2408.12772},
year = {2024}
}