中文

PeCo:用于视觉 Transformer BERT 预训练的感知码本

计算机视觉与模式识别 2022-12-19 v3 机器学习

摘要

本文探索了视觉 Transformer BERT 预训练中一个更优的预测目标。我们观察到当前的预测目标与人类感知判断不一致。这一矛盾促使我们学习一个感知预测目标。我们认为,感知上相似的图像在预测目标空间中应彼此接近。我们意外地发现了一个简单而有效的想法:在 dVAE 训练期间强制施加感知相似性。此外,我们采用了一个自监督 Transformer 模型进行深层特征提取,并证明其在计算感知相似性方面表现良好。我们证明,这样学习到的视觉 Token 确实展现出更好的语义含义,并有助于预训练在各种下游任务中取得优越的迁移性能。例如,我们使用 ViT-B 骨干网络在 ImageNet-1K 上达到了 84.5%\textbf{84.5\%} 的 Top-1 准确率,在相同预训练轮次下,比竞争方法 BEiT 高出 +1.3%\textbf{+1.3\%}。我们的方法在 COCO 上的目标检测与分割以及 ADE20K 上的语义分割任务中也取得了显著提升。配备更大的 ViT-H 骨干网络后,我们在仅使用 ImageNet-1K 数据的方法中取得了最先进的 ImageNet 准确率(\textbf{88.3\%})。

关键词

引用

@article{arxiv.2111.12710,
  title  = {PeCo: Perceptual Codebook for BERT Pre-training of Vision Transformers},
  author = {Xiaoyi Dong and Jianmin Bao and Ting Zhang and Dongdong Chen and Weiming Zhang and Lu Yuan and Dong Chen and Fang Wen and Nenghai Yu and Baining Guo},
  journal= {arXiv preprint arXiv:2111.12710},
  year   = {2022}
}

备注

To appear at AAAI 2023