中文

面向视觉 Transformer 预训练的视觉 token 掩码与置换学习

计算机视觉与模式识别 2025-01-23 v2 人工智能 多媒体

摘要

自监督预训练的使用已成为提升多种视觉任务性能的一种有前景的方法。在此背景下,近期方法采用了掩码图像建模范式,通过重建与随机掩码图像块相关的视觉 token 来预训练骨干网络。然而,这种掩码方法在预训练期间向输入数据引入噪声,导致差异,从而可能损害微调阶段的性能。此外,输入掩码忽略了被腐蚀块之间的依赖关系,增加了下游微调任务中观察到的不一致性。为克服这些问题,我们提出了一种名为掩码与置换视觉 Transformer(MaPeT)的新自监督预训练方法,其采用自回归与置换预测来捕获块内依赖。另外,MaPeT 利用辅助位置信息来减小预训练与微调阶段之间的差异。在我们的实验中,我们采用公平设置以确保可靠且有意义的比较,并对多种视觉 tokenizer 进行了研究,包括我们提出的 kk-CLIP(其直接采用离散化的 CLIP 特征)。我们的结果表明,在相同模型设置下,MaPeT 在 ImageNet 上相较于基线与竞争方法取得了有竞争力的性能。我们在 https://github.com/aimagelab/MaPeT 发布了我们的代码与模型实现。

关键词

引用

@article{arxiv.2306.07346,
  title  = {Learning to Mask and Permute Visual Tokens for Vision Transformer Pre-Training},
  author = {Lorenzo Baraldi and Roberto Amoroso and Marcella Cornia and Lorenzo Baraldi and Andrea Pilzer and Rita Cucchiara},
  journal= {arXiv preprint arXiv:2306.07346},
  year   = {2025}
}

备注

Computer Vision and Image Understanding (2025)