视觉 Transformer 需要寄存器
计算机视觉与模式识别
2024-04-15 v2
摘要
Transformer 近来已成为学习视觉表征的有力工具。在本文中,我们识别并刻画了有监督与自监督 ViT 网络特征图中的伪影。这些伪影对应于推理过程中主要出现在图像低信息量背景区域、被重新用于内部计算的高范数 token。我们提出了一种简单而有效的解决方案,即向 Vision Transformer 的输入序列提供额外的 token 来充当该角色。我们表明,该方案完全修复了有监督与自监督模型中的该问题,在密集视觉预测任务上为自监督视觉模型树立了新 SOTA,使更大模型的物体发现方法成为可能,并且最重要的是为下游视觉处理带来了更平滑的特征图与注意力图。
引用
@article{arxiv.2309.16588,
title = {Vision Transformers Need Registers},
author = {Timothée Darcet and Maxime Oquab and Julien Mairal and Piotr Bojanowski},
journal= {arXiv preprint arXiv:2309.16588},
year = {2024}
}