用于自监督表示学习的上下文自编码器
计算机视觉与模式识别
2023-08-11 v3
摘要
我们提出一种新颖的掩码图像建模(MIM)方法——上下文自编码器(CAE),用于自监督表示预训练。我们通过在编码表示空间中进行预测来预训练编码器。预训练任务包括两项:掩码表示预测——预测掩码块的表示;以及掩码块重建——重建掩码块。网络采用编码器-回归器-解码器架构:编码器以可见块为输入;回归器利用可见块的表示以及可见与掩码块的位置,预测掩码块的表示,这些表示预期与编码器计算的表示对齐;解码器从预测的编码表示中重建掩码块。CAE 的设计鼓励将学习编码器(表示)与完成预训练任务(掩码表示预测和掩码块重建)分离,并且在编码表示空间中进行预测的经验表明其有益于表示学习。我们通过下游任务中优越的迁移性能证明了 CAE 的有效性:语义分割、目标检测与实例分割,以及分类。代码将发布于 https://github.com/Atten4Vis/CAE。
引用
@article{arxiv.2202.03026,
title = {Context Autoencoder for Self-Supervised Representation Learning},
author = {Xiaokang Chen and Mingyu Ding and Xiaodi Wang and Ying Xin and Shentong Mo and Yunhao Wang and Shumin Han and Ping Luo and Gang Zeng and Jingdong Wang},
journal= {arXiv preprint arXiv:2202.03026},
year = {2023}
}
备注
Accepted by International Journal of Computer Vision (IJCV)