中文

视觉及更广义自监督学习中掩码自编码器的综述

计算机视觉与模式识别 2022-08-02 v1 人工智能 机器学习

摘要

掩码自编码器是可扩展的视觉学习器,正如 MAE \cite{he2022masked} 的标题所示,这表明视觉中的自监督学习(SSL)可能走上与 NLP 类似的轨迹。具体而言,带有掩码预测的 generative pretext tasks(例如 BERT)已成为 NLP 中事实上的标准 SSL 做法。相比之下,视觉中生成式方法的早期尝试已被其判别式对应方法(如对比学习)所埋没;然而,掩码图像建模的成功复兴了掩码自编码器(过去常称为去噪自编码器)。作为弥合与 NLP 中 BERT 差距的里程碑,掩码自编码器在视觉及更广义的 SSL 中吸引了前所未有的关注。本工作对掩码自编码器进行了全面综述,以阐明 SSL 的一个有前景的方向。作为首篇综述基于掩码自编码器的 SSL 的工作,本文聚焦于其在视觉中的应用,讨论其历史发展、近期进展以及对多样应用的启示。

关键词

引用

@article{arxiv.2208.00173,
  title  = {A Survey on Masked Autoencoder for Self-supervised Learning in Vision and Beyond},
  author = {Chaoning Zhang and Chenshuang Zhang and Junha Song and John Seon Keun Yi and Kang Zhang and In So Kweon},
  journal= {arXiv preprint arXiv:2208.00173},
  year   = {2022}
}

备注

First survey on masked autoencoder (under progress)