中文

结合自涌现 Token 标注的全注意力网络

计算机视觉与模式识别 2024-01-09 v1

摘要

近期研究表明,Vision Transformers (ViTs) 对分布外场景具有鲁棒性。特别是,作为 ViT 骨干网络家族的全注意力网络已实现了 SOTA 的鲁棒性。在本文中,我们重新审视 FAN 模型,并利用自涌现 token 标注框架改进其预训练。我们的方法包含一个两阶段训练框架。具体而言,我们首先训练一个 FAN token 标注器以生成具有语义意义的图像块 token 标签,随后进行 FAN 学生模型训练阶段,该阶段同时使用 token 标签和原始类标签。借助所提出的 STL 框架,我们基于 FAN-L-Hybrid(77.3M 参数)的最佳模型在 ImageNet-1K 和 ImageNet-C 上分别实现了 84.8% 的 Top-1 准确率和 42.1% 的 mCE,并在不使用额外数据的情况下,在 ImageNet-A (46.1%) 和 ImageNet-R (56.6%) 上创下了新的 SOTA,以显著优势优于原始 FAN 对应模型。所提出的框架在语义分割等下游任务上也展示了显著提升的性能,鲁棒性较对应模型提高了 1.7%。代码可在 https://github.com/NVlabs/STL 获取。

关键词

引用

@article{arxiv.2401.03844,
  title  = {Fully Attentional Networks with Self-emerging Token Labeling},
  author = {Bingyin Zhao and Zhiding Yu and Shiyi Lan and Yutao Cheng and Anima Anandkumar and Yingjie Lao and Jose M. Alvarez},
  journal= {arXiv preprint arXiv:2401.03844},
  year   = {2024}
}