中文

视觉 Transformer 不需要训练好的寄存� token

计算机视觉与模式识别 2025-10-28 v5 人工智能

摘要

我们研究了 Vision Transformer 中一个先前识别出的现象的背后机制——高范数 token 的出现导致注意力图噪声化(Darcet 等,2024)。我们观察到在多个模型(例如 CLIP、DINOv2)中,稀疏的神经元集合负责将高范数激活集中在异常 token 上,导致注意力模式不规则并降低下游视觉处理性能。虽然现有的解决方法涉及通过额外学习的寄存 token 从头重新训练模型,但我们利用所发现的发现,创建了一个无需训练即可缓解这些制件的方法。通过将高范数激活从我们发现的寄存神经元转移到额外的未训练 token 中,我们可以模拟寄存 token 在已训练无寄存 token 模型上的效果。我们展示我们的方法产生更干净的注意力和特征图,提升了多个下游视觉任务上的性能,结果相当于明确训练带寄存 token 的模型。我们随后将 test-time registers 扩展到即插即用视觉语言模型,实现更干净的基于注意力的文本到图像归因。最后,我们勾勒出一种简单的数学模型来反映寄存神经元和高范数 token 的观察行为。我们的结果表明,test-time registers 在发挥寄存 token 在 test-time 作用的方面,为任何未配备寄存 token 的预训练模型提供了无需训练的解决方案。

关键词

引用

@article{arxiv.2506.08010,
  title  = {Vision Transformers Don't Need Trained Registers},
  author = {Nick Jiang and Amil Dravid and Alexei Efros and Yossi Gandelsman},
  journal= {arXiv preprint arXiv:2506.08010},
  year   = {2025}
}

备注

Project page and code: https://avdravid.github.io/test-time-registers. Accepted to NeurIPS '25 (spotlight)