DropPos:通过重建丢弃位置预训练视觉Transformer
计算机视觉与模式识别
2023-09-25 v2
摘要
由于经验观察到视觉Transformer(ViTs)对输入词元的顺序相当不敏感,对一种能增强ViT位置感知能力的适当自监督代理任务的需求日益显现。为此,我们提出DropPos,一种旨在重建丢弃位置(Dropped Positions)的新颖代理任务。DropPos的构造很简单:我们首先丢弃一大部分随机的位置嵌入子集,然后模型仅基于每个非重叠图像块的可视外观,在所有可能位置中分类其实际位置。为避免平凡解,我们通过仅保留可见图像块子集来增加该任务的难度。此外,考虑到可能存在视觉外观相似的不同图像块,我们提出位置平滑和注意力重建策略以放宽该分类问题,因为在这些情况下无需重建其精确位置。DropPos的经验评估显示出强大能力。DropPos优于监督预训练,并在广泛下游基准上与最先进(SOTA)自监督替代方法取得有竞争力的结果。这表明,如DropPos那样显式激励空间推理能力确实有助于提升ViT的位置感知。代码公开于 https://github.com/Haochen-Wang409/DropPos。
引用
@article{arxiv.2309.03576,
title = {DropPos: Pre-Training Vision Transformers by Reconstructing Dropped Positions},
author = {Haochen Wang and Junsong Fan and Yuxi Wang and Kaiyou Song and Tong Wang and Zhaoxiang Zhang},
journal= {arXiv preprint arXiv:2309.03576},
year = {2023}
}
备注
Accepted by NeurIPS 2023