中文

i-MAE:掩码自编码器中的潜在表示是否线性可分?

计算机视觉与模式识别 2024-04-10 v2 人工智能 机器学习

摘要

掩码图像建模(MIM)已被认为是视觉领域中一种强大的自监督预训练方法。然而,此种方案所学表示的内在机制与性质,以及如何进一步增强表示,迄今尚未被充分探索。本文中,我们旨在探索一种交互式掩码自编码器(i-MAE)框架,从两方面增强表示能力:(1)采用双向图像重建与带蒸馏损失的潜在特征重建以学习更好的特征;(2)提出语义增强采样策略以提升MAE中学到的语义。基于所提出的i-MAE架构,我们可解决两个关键问题以探索MAE中学得表示的行为:(1)掩码自编码器中潜在表示的可分性是否有助于模型性能?我们通过将输入强制为两幅图像而非一幅的混合来研究此问题。(2)我们能否通过在采样时控制掩码自编码器中语义的程度来增强潜在特征空间中的表示?为此,我们提出一种基于训练样本语义的小批量内采样策略以检验该方面。我们在CIFAR-10/100、Tiny-ImageNet和ImageNet-1K上进行了大量实验以验证我们的发现。此外,除定性分析潜在表示的特征外,我们提出两种评估方案来检验潜在空间中线性可分性的存在与语义的程度。令人惊讶且一致的结果表明,i-MAE是用于理解MAE框架以及取得更强表示能力的优越框架设计。代码见 https://github.com/vision-learning-acceleration-lab/i-mae。

关键词

引用

@article{arxiv.2210.11470,
  title  = {i-MAE: Are Latent Representations in Masked Autoencoders Linearly Separable?},
  author = {Kevin Zhang and Zhiqiang Shen},
  journal= {arXiv preprint arXiv:2210.11470},
  year   = {2024}
}

备注

Project page: https://zhiqiangshen.com/projects/i-mae/