中文

通过层次潜变量模型理解掩码自编码器

机器学习 2023-06-09 v1 计算机视觉与模式识别

摘要

掩码自编码器(MAE)是一种基于掩码图像区域重建的简单而有效的自监督学习框架,近期在各种视觉任务中取得了显著成功。尽管出现了关于 MAE 的有趣经验观察,其理论原理性的理解仍然缺乏。本工作中,我们正式刻画并论证了已有的经验洞见,并给出了 MAE 的理论保证。我们将底层数据生成过程表述为层次潜变量模型,并证明在合理假设下,MAE 可证明地辨识出该层次模型中的一组潜变量,解释了为何 MAE 能从像素中提取高层信息。进一步,我们展示了 MAE 中的关键超参数(掩码比例与图像块大小)如何决定恢复哪些真实潜变量,从而影响表示中语义信息的层次。具体而言,极大或极小的掩码比例不可避免地导致低层表示。我们的理论对已有经验观察提供了连贯解释,并为掩码-重建范式的潜在经验改进与根本局限提供了洞见。我们进行了大量实验以验证我们的理论洞见。

关键词

引用

@article{arxiv.2306.04898,
  title  = {Understanding Masked Autoencoders via Hierarchical Latent Variable Models},
  author = {Lingjing Kong and Martin Q. Ma and Guangyi Chen and Eric P. Xing and Yuejie Chi and Louis-Philippe Morency and Kun Zhang},
  journal= {arXiv preprint arXiv:2306.04898},
  year   = {2023}
}

备注

CVPR 2023 Highlight