中文

通过感知理解改进视觉表征学习

计算机视觉与模式识别 2023-03-29 v2

摘要

我们提出了一种对掩码自编码器(MAE)的扩展,通过显式鼓励学习更高层次的场景级特征来改进模型所学到的表征。为此我们做了以下工作:(i) 在生成图像与真实图像之间引入感知相似度项;(ii) 结合对抗训练文献中的若干技术,包括多尺度训练与自适应判别器增强。这些方法的结合不仅带来了更好的像素重建,还产生了似乎能更好地捕捉图像中高层细节的表征。更重要的是,我们展示了我们的方法——感知MAE(Perceptual MAE)——用于下游任务时带来更好的性能,优于先前的方法。我们在ImageNet-1K上实现了78.1%的线性探测top-1准确率,微调时可达88.1%,在其他下游任务上也有类似结果,且均未使用额外的预训练模型或数据。

关键词

引用

@article{arxiv.2212.14504,
  title  = {Improving Visual Representation Learning through Perceptual Understanding},
  author = {Samyakh Tukra and Frederick Hoffman and Ken Chatfield},
  journal= {arXiv preprint arXiv:2212.14504},
  year   = {2023}
}

备注

v2: add additional details on MSG-MAE. In Proc CVPR 2023