面向快速预训练的对象级掩码自编码器
计算机视觉与模式识别
2022-05-31 v1 机器学习
摘要
无标签图像的自监督预训练近期在图像分类中取得了令人瞩目的性能。基于 transformer 的方法 ViT 和 MAE 的成功,使学界关注于骨干网络架构与自监督任务的设计。在本工作中,我们指出当前的掩码图像编码模型学习的是整个场景中全部对象之间的潜在关系,而非单一对象的表征。因此,这些方法在自监督预训练中带来了大量计算时间。为解决此问题,我们引入一种新颖的对象选择与划分策略,通过感兴趣区域掩码的选择性重建来丢弃非对象图像块,从而学习对象级表征。我们将该方法称为 ObjMAE。在四个常用数据集上的大量实验证明了我们的模型在将计算成本降低 72% 的同时取得了具有竞争力的性能。此外,我们探究了对象间与对象内的关系,发现后者对于自监督预训练至关重要。
引用
@article{arxiv.2205.14338,
title = {Object-wise Masked Autoencoders for Fast Pre-training},
author = {Jiantao Wu and Shentong Mo},
journal= {arXiv preprint arXiv:2205.14338},
year = {2022}
}