中文

利用视觉 Transformer 中的寄存器实现鲁棒自适应

计算机视觉与模式识别 2025-01-10 v1 机器学习

摘要

视觉 Transformer 因其捕捉全局图像表示的能力,在多种任务中取得了成功。近期研究发现了 ViT 中存在高范数 token,这可能会干扰无监督目标发现。为了解决这一问题,已有研究提出使用“寄存器”,即额外的 token,用于隔离高范数 patch token,同时捕捉全局图像级信息。尽管寄存器在目标发现方面已有广泛研究,但其泛化特性,尤其是在分布外场景下的泛化特性,仍未被充分探索。在本文中,我们研究了寄存器 token 嵌入在提供额外特征以改善泛化和异常拒绝方面的效用。为此,我们提出了一种简单的方法,将 ViT 中常用的特殊 CLS token 嵌入与平均池化的寄存器嵌入相结合,创建特征表示,随后用于训练下游分类器。我们发现这增强了 OOD 泛化和异常拒绝能力,同时保持了分布内性能。在多个带有和不带寄存器训练的 ViT 主干上进行的大量实验表明,top-1 OOD 准确率持续提升 2-4%,异常检测的假阳性率降低 2-3%。重要的是,这些增益是在没有额外计算开销的情况下实现的。

关键词

引用

@article{arxiv.2501.04784,
  title  = {Leveraging Registers in Vision Transformers for Robust Adaptation},
  author = {Srikar Yellapragada and Kowshik Thopalli and Vivek Narayanaswamy and Wesam Sakla and Yang Liu and Yamen Mubarka and Dimitris Samaras and Jayaraman J. Thiagarajan},
  journal= {arXiv preprint arXiv:2501.04784},
  year   = {2025}
}

备注

Accepted at ICASSP 2025