中文

面向域泛化的自蒸馏视觉Transformer

计算机视觉与模式识别 2022-10-06 v3 人工智能 机器学习

摘要

近年来,已有若干域泛化(DG)方法被提出,展现出令人鼓舞的性能,然而几乎所有这些方法都构建在卷积神经网络(CNN)之上。关于视觉Transformer(ViT)的DG性能研究进展甚少甚至没有,而ViT在标准基准上正挑战着CNN的霸主地位,这些基准通常建立在独立同分布(i.i.d)假设之上。这使得ViT在真实世界中的部署令人存疑。本文中,我们尝试探索ViT以解决DG问题。与CNN类似,ViT在分布外场景中同样表现不佳,其主要症结在于对源域的过拟合。受ViT模块化架构的启发,我们提出了一种简单的ViT DG方法,称为ViT自蒸馏。该方法通过为中间Transformer块构建非零熵监督信号,简化输入—输出映射问题的学习,从而减轻对源域的过拟合。此外,它不引入任何新参数,并可无缝插入不同ViT的模块化组合中。我们在五个具有挑战性的数据集上,通过不同的DG基线和各种ViT骨干网络,实证展示了显著的性能提升。而且,我们报告了相对于近期最先进DG方法的有利性能。我们的代码及预训练模型公开于:https://github.com/maryam089/SDViT。

关键词

引用

@article{arxiv.2207.12392,
  title  = {Self-Distilled Vision Transformer for Domain Generalization},
  author = {Maryam Sultana and Muzammal Naseer and Muhammad Haris Khan and Salman Khan and Fahad Shahbaz Khan},
  journal= {arXiv preprint arXiv:2207.12392},
  year   = {2022}
}

备注

23 pages, 12 figures