中文

注意力引导的掩码自编码器用于学习图像表示

计算机视觉与模式识别 2024-02-26 v1 机器学习

摘要

掩码自编码器(MAE)已成为计算机视觉任务中无监督预训练的强大方法。虽然普通MAE对重建图像的各个部分给予同等重视,但我们提出通过注意力引导的损失函数来指导重建过程。通过利用无监督目标发现的最新进展,我们获得场景的注意力图,并将其用于损失函数中,以增加对重建相关对象的重视,从而有效地激励模型学习更面向对象的表示,同时不损害既定的掩码策略。我们的评估表明,我们的预训练模型比普通MAE学习到更好的潜在表示,这在多个基准测试上通过改进的线性探测和k-NN分类结果得到证明,同时使ViT对变化的背景更加鲁棒。

关键词

引用

@article{arxiv.2402.15172,
  title  = {Attention-Guided Masked Autoencoders For Learning Image Representations},
  author = {Leon Sick and Dominik Engel and Pedro Hermosilla and Timo Ropinski},
  journal= {arXiv preprint arXiv:2402.15172},
  year   = {2024}
}