中文

优化视觉 Transformer 的相关性图可提升鲁棒性

计算机视觉与模式识别 2022-06-03 v1

摘要

已观察到视觉分类模型往往主要依赖图像背景而忽略前景,这损害了其对分布变化的鲁棒性。为缓解这一缺陷,我们提出监控模型的相关性信号并对其进行操控,使模型聚焦于前景物体。这作为一个微调步骤完成,涉及相对较少的由图像及其对应前景掩码组成的样本对。具体而言,我们鼓励模型的相关性图 (i) 对背景区域赋予较低相关性,(ii) 尽可能从前景获取信息,并且 (iii) 我们鼓励决策具有高置信度。当应用于 Vision Transformer (ViT) 模型时,观察到其对域偏移的鲁棒性有显著提升。此外,前景掩码可由 ViT 模型自身的自监督变体自动获得,因此无需额外监督。

关键词

引用

@article{arxiv.2206.01161,
  title  = {Optimizing Relevance Maps of Vision Transformers Improves Robustness},
  author = {Hila Chefer and Idan Schwartz and Lior Wolf},
  journal= {arXiv preprint arXiv:2206.01161},
  year   = {2022}
}