探索掩码自编码器的目标表示
计算机视觉与模式识别
2023-03-28 v3
摘要
掩码自编码器已成为自监督视觉表示学习的流行训练范式。这些模型随机掩码部分输入,并依据目标表示重建被掩码部分。在本文中,我们首先表明,对于学习良好表示而言,仔细选择目标表示是不必要的,因为不同目标往往导出行为相似的模型。受此观察驱动,我们提出了一个多阶段掩码蒸馏流程,并使用随机初始化的模型作为教师,使我们能够有效训练高容量模型而无需任何精心设计方案目标表示的工作。有趣的是,我们进一步探索使用更大容量的教师,获得了具有显著迁移能力的学生。在分类、迁移学习、目标检测与语义分割的不同任务上,所提出的以自举教师执行掩码知识蒸馏的方法(dBOT)以非平凡优势超越先前的自监督方法。我们希望我们的发现以及所提方法,能促使人们重新思考目标表示在预训练掩码自编码器中的作用。代码与预训练模型公开于 https://github.com/liuxingbin/dbot。
引用
@article{arxiv.2209.03917,
title = {Exploring Target Representations for Masked Autoencoders},
author = {Xingbin Liu and Jinghao Zhou and Tao Kong and Xianming Lin and Rongrong Ji},
journal= {arXiv preprint arXiv:2209.03917},
year = {2023}
}
备注
The first two authors contributed equally