注意力引导的掩码自编码器用于学习图像表示
计算机视觉与模式识别
2024-02-26 v1 机器学习
摘要
掩码自编码器(MAE)已成为计算机视觉任务中无监督预训练的强大方法。虽然普通MAE对重建图像的各个部分给予同等重视,但我们提出通过注意力引导的损失函数来指导重建过程。通过利用无监督目标发现的最新进展,我们获得场景的注意力图,并将其用于损失函数中,以增加对重建相关对象的重视,从而有效地激励模型学习更面向对象的表示,同时不损害既定的掩码策略。我们的评估表明,我们的预训练模型比普通MAE学习到更好的潜在表示,这在多个基准测试上通过改进的线性探测和k-NN分类结果得到证明,同时使ViT对变化的背景更加鲁棒。
引用
@article{arxiv.2402.15172,
title = {Attention-Guided Masked Autoencoders For Learning Image Representations},
author = {Leon Sick and Dominik Engel and Pedro Hermosilla and Timo Ropinski},
journal= {arXiv preprint arXiv:2402.15172},
year = {2024}
}