视觉及更广义自监督学习中掩码自编码器的综述
计算机视觉与模式识别
2022-08-02 v1 人工智能
机器学习
摘要
掩码自编码器是可扩展的视觉学习器,正如 MAE \cite{he2022masked} 的标题所示,这表明视觉中的自监督学习(SSL)可能走上与 NLP 类似的轨迹。具体而言,带有掩码预测的 generative pretext tasks(例如 BERT)已成为 NLP 中事实上的标准 SSL 做法。相比之下,视觉中生成式方法的早期尝试已被其判别式对应方法(如对比学习)所埋没;然而,掩码图像建模的成功复兴了掩码自编码器(过去常称为去噪自编码器)。作为弥合与 NLP 中 BERT 差距的里程碑,掩码自编码器在视觉及更广义的 SSL 中吸引了前所未有的关注。本工作对掩码自编码器进行了全面综述,以阐明 SSL 的一个有前景的方向。作为首篇综述基于掩码自编码器的 SSL 的工作,本文聚焦于其在视觉中的应用,讨论其历史发展、近期进展以及对多样应用的启示。
引用
@article{arxiv.2208.00173,
title = {A Survey on Masked Autoencoder for Self-supervised Learning in Vision and Beyond},
author = {Chaoning Zhang and Chenshuang Zhang and Junha Song and John Seon Keun Yi and Kang Zhang and In So Kweon},
journal= {arXiv preprint arXiv:2208.00173},
year = {2022}
}
备注
First survey on masked autoencoder (under progress)