ConvMAE:掩码卷积遇见掩码自编码器
计算机视觉与模式识别
2022-05-20 v2
摘要
Vision Transformers (ViT) 已成为各类视觉任务中广泛采用的架构。用于特征预训练的掩码自编码和多尺度混合卷积-Transformer 架构可进一步释放 ViT 的潜力,在图像分类、检测和语义分割上取得最先进的性能。本文中,我们的 ConvMAE 框架表明,多尺度混合卷积-Transformer 可通过掩码自编码方案学习更具判别力的表示。然而,直接使用原始掩码策略会导致巨大的计算开销和预训练-微调不一致。为解决该问题,我们采用掩码卷积来防止卷积块中的信息泄漏。提出了一种简单的块级掩码策略以保证计算效率。我们还提出对编码器的多尺度特征进行更直接的监督以提升多尺度特征。基于我们预训练的 ConvMAE 模型,ConvMAE-Base 相比 MAE-Base 在 ImageNet-1K 微调精度上提升 1.4%。在目标检测上,仅微调 25 轮的 ConvMAE-Base 分别超越微调 100 轮的 MAE-Base 达 2.9% box AP 和 2.2% mask AP。代码和预训练模型见 https://github.com/Alpha-VL/ConvMAE。
引用
@article{arxiv.2205.03892,
title = {ConvMAE: Masked Convolution Meets Masked Autoencoders},
author = {Peng Gao and Teli Ma and Hongsheng Li and Ziyi Lin and Jifeng Dai and Yu Qiao},
journal= {arXiv preprint arXiv:2205.03892},
year = {2022}
}
备注
10 pages