中文

所有视觉Transformer都需要寄存器吗?跨架构的重新评估

计算机视觉与模式识别 2026-03-30 v1 机器学习

摘要

训练视觉Transformer(ViT)面临着重大挑战,其中之一是注意力图中出现伪影,阻碍了其可解释性。Darcet等人(2024)研究了这一现象,并将其归因于ViT需要存储超出[CLS]令牌的全局信息。他们提出了一种新颖的解决方案,涉及添加名为寄存器的空输入令牌,成功消除了伪影并提高了注意力图的清晰度。在这项工作中,我们复现了Darcet等人(2024)的发现,并评估了他们的主张在多个模型(包括DINO、DINOv2、OpenCLIP和DeiT3)中的泛化能力。虽然我们证实了他们几个关键主张的有效性,但我们的结果表明,一些主张并不能普遍扩展到其他模型。此外,我们探讨了模型大小的影响,将其发现扩展到更小的模型。最后,我们梳理了原始论文中发现的术语不一致之处,并解释了它们在推广到更广泛模型时的影响。

关键词

引用

@article{arxiv.2603.25803,
  title  = {Do All Vision Transformers Need Registers? A Cross-Architectural Reassessment},
  author = {Spiros Baxevanakis and Platon Karageorgis and Ioannis Dravilas and Konrad Szewczyk},
  journal= {arXiv preprint arXiv:2603.25803},
  year   = {2026}
}

备注

Preprint. Submitted to Transactions on Machine Learning Research (TMLR). 26 pages, 17 figures