中文

从局部对比视角理解掩码自编码器

计算机视觉与模式识别 2023-12-11 v2

摘要

掩码自编码器(MAE)以其简洁而有效的掩码与重建策略革新了自监督学习领域。然而,尽管在各种下游视觉任务上取得了最先进的性能,驱动 MAE 有效性的底层机制相较于典型对比学习范式较少被探究。本文中,我们首先提出一种局部视角,从 MAE 在块级别的重建目标中显式提取局部对比形式。接着引入一种称为局部对比 MAE(LC-MAE)的新实证框架,以分析 MAE 的重建与对比两方面。LC-MAE 揭示 MAE 学习对随机掩码的不变性,并确保所学 token 嵌入与原始图像间的分布一致性。此外,我们剖析解码器与随机掩码对 MAE 成功的贡献,揭示解码器的学习机制以及随机掩码作为数据增强与有效感受野限制的双重作用。我们的实验分析阐明了 MAE 的复杂性,并总结了一些有用的设计方法,可启发更强大的视觉自监督方法。

关键词

引用

@article{arxiv.2310.01994,
  title  = {Understanding Masked Autoencoders From a Local Contrastive Perspective},
  author = {Xiaoyu Yue and Lei Bai and Meng Wei and Jiangmiao Pang and Xihui Liu and Luping Zhou and Wanli Ouyang},
  journal= {arXiv preprint arXiv:2310.01994},
  year   = {2023}
}