中文

视觉 Transformer 对虚假相关性是否具有鲁棒性?

计算机视觉与模式识别 2022-03-18 v1 人工智能 机器学习

摘要

深度神经网络可能易于学习在平均意义上成立但在非典型测试样本中不成立的虚假相关性。随着视觉 Transformer(ViT)模型的近期涌现,此类架构中虚假相关性的表现方式仍未被充分探索。本文中,我们系统性地研究了视觉 Transformer 在三个具挑战性的基准数据集上对虚假相关性的鲁棒性,并将其性能与流行的 CNN 进行比较。我们的研究表明,当在足够大规模的数据集上预训练时,ViT 模型比 CNN 对虚假相关性更具鲁棒性。其成功的关键在于能够更好地从虚假相关性不成立的样本中泛化。此外,我们进行了广泛的消融实验与研究,以理解自注意力机制在虚假相关环境下提供鲁棒性中的作用。我们希望本工作能启发未来对 ViT 模型鲁棒性的进一步理解。

关键词

引用

@article{arxiv.2203.09125,
  title  = {Are Vision Transformers Robust to Spurious Correlations?},
  author = {Soumya Suvra Ghosal and Yifei Ming and Yixuan Li},
  journal= {arXiv preprint arXiv:2203.09125},
  year   = {2022}
}