具自一致性的高效掩码自编码器
计算机视觉与模式识别
2024-06-04 v2
摘要
受自然语言处理任务中掩码语言建模(MLM)的启发,掩码图像建模(MIM)已被公认为计算机视觉中一种强的自监督预训练方法。然而,MIM的高随机掩码率导致两个严重问题:1)每次迭代中图像数据利用不充分带来预训练时间延长;2)预测的高不一致性导致生成不可靠,即同一补丁的预测在不同掩码轮次中可能不一致,导致最终生成结果中语义发散。为解决这些问题,我们提出具自一致性的高效掩码自编码器(EMAE)以提升预训练效率并增加MIM的一致性。具体而言,我们提出一种并行掩码策略,将图像划分为K个不重叠部分,每部分由相同掩码率的随机掩码生成。然后MIM任务在一次迭代中所有部分上并行进行,模型最小化预测与掩码补丁间的损失。此外,我们设计自一致性学习以进一步保持各部分间重叠掩码补丁预测的一致性。总体上,我们的方法能更高效利用数据并获得可靠表征。在ImageNet上的实验表明,EMAE在仅使用13%的MAE预训练时间(基于NVIDIA A100 GPUs)下于ViT-Large上取得最佳性能。在多种数据集上预训练后,EMAE在图像分类、目标检测和语义分割等多种下游任务上持续获得最先进的迁移能力。
引用
@article{arxiv.2302.14431,
title = {Efficient Masked Autoencoders with Self-Consistency},
author = {Zhaowen Li and Yousong Zhu and Zhiyang Chen and Wei Li and Chaoyang Zhao and Rui Zhao and Ming Tang and Jinqiao Wang},
journal= {arXiv preprint arXiv:2302.14431},
year = {2024}
}
备注
Accept by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)