中文

AdPE:通过对抗位置嵌入经由 MAE+ 预训练视觉 Transformer

计算机视觉与模式识别 2023-03-15 v1 人工智能 机器学习

摘要

视觉 Transformer 的无监督学习旨在通过无标签的代理任务预训练编码器。其中,掩码图像建模(MIM)作为一种代理任务,通过预测被掩码的图块来与语言 Transformer 的预训练相对齐。无监督预训练的一个准则是代理任务需要足够困难,以防止 Transformer 编码器学习到对下游任务泛化性差的平凡低级特征。为此,我们提出了一种对抗位置嵌入(AdPE)方法——它通过扰动位置编码来扭曲局部视觉结构,使得学习到的 Transformer 无法简单地利用局部相关的图块来预测缺失图块。我们假设这迫使 Transformer 编码器在全局上下文中学习更具判别性的特征,从而对下游任务具有更强的泛化能力。我们将考虑绝对与相对位置编码,其中对抗位置可在嵌入模式和坐标模式下施加。我们还将提出一个新的 MAE+ 基线,借助 AdPE 将 MIM 预训练的性能提升到新水平。实验表明,在 ImageNet1K 上预训练 ViT-B 和 ViT-L 各 1600 个 epoch 时,我们的方法可将 MAE 的微调准确率分别提高 0.8%0.8\%0.4%0.4\%。在迁移学习任务中,以 ViT-B 为骨干网络时,它在 ADE20K 上的 mIoU 优于 MAE 2.6%2.6\%,在 COCO 上的 APbbox^{bbox} 和 APmask^{mask} 分别优于 3.2%3.2\%1.6%1.6\%。这些结果是在 AdPE 作为一种纯 MIM 方法、不使用任何额外模型或外部数据集进行预训练的情况下取得的。代码见 https://github.com/maple-research-lab/AdPE。

关键词

引用

@article{arxiv.2303.07598,
  title  = {AdPE: Adversarial Positional Embeddings for Pretraining Vision Transformers via MAE+},
  author = {Xiao Wang and Ying Wang and Ziwei Xuan and Guo-Jun Qi},
  journal= {arXiv preprint arXiv:2303.07598},
  year   = {2023}
}

备注

9 pages, 5 figures