中文

深入探究视觉Transformer在分布偏移下的泛化能力

计算机视觉与模式识别 2022-03-09 v4

摘要

视觉Transformer(ViTs)在各种视觉任务上取得了令人印象深刻的性能,但其在分布偏移(DS)下的泛化能力却鲜为人知。在这项工作中,我们全面研究了ViTs的分布外(OOD)泛化。为进行系统性调查,我们首先提出了一种DS的分类法。随后,我们在不同的DS下对ViT变体进行了广泛评估,并将其泛化能力与卷积神经网络(CNN)模型进行比较。我们得到了重要观察:1)ViTs对背景和纹理学习到较弱的偏置,而它们具备更强的面向形状和结构的归纳偏置,这与人类认知特征更为一致。因此,ViTs在DS下的泛化优于CNNs。在相同或更少的参数量下,在大多数类型的DS下,ViTs的top-1准确率领先相应CNNs超过5%。2)随着模型规模增大,ViTs强化了这些偏置,从而逐渐缩小分布内与OOD性能差距。为进一步提升ViTs的泛化能力,我们从对抗学习、信息论和自监督学习的角度设计了泛化增强视觉Transformer(GE-ViTs)。通过全面研究这些GE-ViTs并与相应的CNN模型比较,我们观察到:1)对于增强模型,更大的ViTs仍对OOD泛化获益更多。2)GE-ViTs比相应CNN模型对超参数更敏感。我们设计了一种更平滑的学习策略以实现稳定的训练过程,并在OOD数据上相较原始ViTs获得4%的性能提升。我们希望我们的全面研究能为设计更具泛化能力的学习架构提供启示。

关键词

引用

@article{arxiv.2106.07617,
  title  = {Delving Deep into the Generalization of Vision Transformers under Distribution Shifts},
  author = {Chongzhi Zhang and Mingyuan Zhang and Shanghang Zhang and Daisheng Jin and Qiang Zhou and Zhongang Cai and Haiyu Zhao and Xianglong Liu and Ziwei Liu},
  journal= {arXiv preprint arXiv:2106.07617},
  year   = {2022}
}

备注

Accepted by CVPR 2022