用于自监督视觉表征学习的混合自编码器
计算机视觉与模式识别
2024-02-08 v3 机器学习
摘要
掩码自编码器(MAE)通过随机掩码图像块并重建,在各种视觉任务上展现出优越性能。然而,与作为最重要环节的对比学习不同,MAE有效的数据增强策略仍是开放问题。本文研究MAE中主流的混合增强。我们首先证明,朴素混合会因互信息(MI)增加而反而退化模型性能。为此,我们提出同源识别这一辅助预文本任务,不仅通过显式要求每个图像块识别同源块来缓解MI增加,还执行物体感知的自监督预训练以提升下游密集感知性能。通过大量实验,我们证明所提混合自编码器(MixedAE)在不同下游任务上以显著效率取得了掩码图像建模(MIM)增强中最优(SOTA)的迁移结果。具体而言,使用标准ViT-Base时,我们的MixedAE在ImageNet-1K、ADE20K与COCO上分别比MAE高出+0.3%精度、+1.7 mIoU与+0.9 AP。此外,MixedAE超越了结合实例判别的强MIM方法iBOT,同时将训练加速2倍。据我们所知,这是首个从预文本任务设计角度考虑MIM混合的工作。代码将公开。
引用
@article{arxiv.2303.17152,
title = {Mixed Autoencoder for Self-supervised Visual Representation Learning},
author = {Kai Chen and Zhili Liu and Lanqing Hong and Hang Xu and Zhenguo Li and Dit-Yan Yeung},
journal= {arXiv preprint arXiv:2303.17152},
year = {2024}
}
备注
Accepted by CVPR 2023