均匀掩码:为具有局部性的基于金字塔的视觉 Transformer 启用 MAE 预训练
摘要
掩码自编码器(MAE)近期以其优雅的非对称编码器-解码器设计引领了视觉自监督领域的趋势,显著优化了预训练效率与微调精度。值得注意的是,该非对称结构的成功依赖于原始视觉 Transformer(ViT)的“全局”特性,其自注意力机制对任意离散图像块子集进行推理。然而,先进的基于金字塔的 ViT(如 PVT、Swin)如何用于 MAE 预训练仍不清楚,因为它们通常在“局部”窗口内引入算子,难以处理部分视觉 token 的随机序列。本文提出均匀掩码(UM),成功为具有局部性的基于金字塔的 ViT 启用 MAE 预训练(简称“UM-MAE”)。具体而言,UM 包含从每个 网格严格采样 个随机块的均匀采样(US),以及将已采样区域中随机掩码一部分(通常为 )作为可学习 token 的二次掩码(SM)。US 在多个不重叠局部窗口间保持等价元素,从而平滑支持流行的基于金字塔的 ViT;而 SM 旨在获得更好的可迁移视觉表征,因为 US 降低了阻碍语义学习的像素重建预任务难度。我们证明 UM-MAE 显著提升了基于金字塔的 ViT 的预训练效率(例如加速约 并降低约 GPU 显存),同时在下游任务上保持有竞争力的微调性能。例如使用 HTC++ 检测器,仅在 ImageNet-1K 上经 UM-MAE 自监督预训练的 Swin-Large 骨干甚至优于在 ImageNet-22K 上监督训练的对应模型。代码见 https://github.com/implus/UM-MAE。
引用
@article{arxiv.2205.10063,
title = {Uniform Masking: Enabling MAE Pre-training for Pyramid-based Vision Transformers with Locality},
author = {Xiang Li and Wenhai Wang and Lingfeng Yang and Jian Yang},
journal= {arXiv preprint arXiv:2205.10063},
year = {2022}
}
备注
An efficient and effective technique that supports MAE-style MIM Pre-training for popular Pyramid-based Vision Transformers (e.g., PVT, Swin)