掩码何以重要:面向掩码自编码器的理论理解
机器学习
2023-03-28 v2 计算机视觉与模式识别
摘要
基于重构任务的掩码自编码器(MAE)已成为自监督学习(SSL)的一种有前景范式,并在不同基准数据集上取得最先进性能。然而,尽管其经验成功令人瞩目,对其的理论理解仍有限。本文中,我们提出对掩码如何影响 MAE 学习有意义特征的理论理解。我们建立 MAE 与对比学习之间的紧密联系,表明 MAE 隐式对齐了掩码诱导的正样本对。基于该联系,我们给出了首个针对 MAE 方法的下游保证,并分析了掩码比例的影响。此外,作为隐式对齐的结果,我们指出了 MAE 的维度坍缩问题,并提出了均匀性增强的 MAE(U-MAE)损失,能有效解决该问题,并在包括 CIFAR-10、ImageNet-100 和 ImageNet-1K 在内的真实数据集上带来显著提升。代码见 (https://github.com/zhangq327/U-MAE)。
引用
@article{arxiv.2210.08344,
title = {How Mask Matters: Towards Theoretical Understandings of Masked Autoencoders},
author = {Qi Zhang and Yifei Wang and Yisen Wang},
journal= {arXiv preprint arXiv:2210.08344},
year = {2023}
}