频域之微妙:用于自监督视觉预训练的孪生格式塔自编码器
计算机视觉与模式识别
2022-04-19 v1
摘要
自监督掩码图像建模(MIM)范式遵循从掩码图像恢复内容的“掩码-重建”流程,因从未标注数据学习视觉表示的优异能力,近期在多媒体界引发日益浓厚的兴趣。为学习具高抽象语义的表示,一组工作尝试以高比例掩码策略重建非语义像素,可能遭遇“过平滑”问题,而另一些工作以离线方式将语义直接注入目标,需额外数据。与之不同,我们将视角转向天然具全局视角的傅里叶域,提出一种新的掩码图像建模(MIM),称为孪生格式塔自编码器(Ge-AE)用于视觉预训练。具体而言,我们为模型配备负责从像素与频率空间双重重建图像内容的孪生解码器,彼此既为补充亦为互约束。借此,预训练编码器中可学到更鲁棒的表示,其有效性由下游识别任务并列实验结果确认。我们还进行了若干定量与定性实验以探究本方法的学习行为。据我们所知,这是首个通过频域视角解决视觉预训练的 MIM 工作。
引用
@article{arxiv.2204.08227,
title = {The Devil is in the Frequency: Geminated Gestalt Autoencoder for Self-Supervised Visual Pre-Training},
author = {Hao Liu and Xinghua Jiang and Xin Li and Antai Guo and Deqiang Jiang and Bo Ren},
journal= {arXiv preprint arXiv:2204.08227},
year = {2022}
}
备注
Tech report