中文

通过重访高频分量改进视觉Transformer

计算机视觉与模式识别 2022-07-28 v3

摘要

Transformer模型在处理各类视觉任务时展现出良好的有效性。然而,与训练卷积神经网络(CNN)模型相比,训练视觉Transformer(ViT)模型更为困难且依赖大规模训练集。为解释该现象,我们提出假设:\textit{ViT模型在捕获图像高频分量上不如CNN模型有效},并通过频率分析加以验证。受此发现启发,我们首先从新的频率视角考察现有改进ViT模型技术的效果,发现部分技术(如RandAugment)的成功可归因于对高频分量的更好利用。随后,为弥补ViT模型的这一不足能力,我们提出HAT,其通过对抗训练直接增强图像的高频分量。我们表明HAT能持续提升多种ViT模型性能(如ViT-B提升+1.2%,Swin-B提升+0.5%),尤其将先进模型VOLO-D5增强至仅使用ImageNet-1K数据的87.3%,且优越性在分布外数据上得以保持并可迁移至下游任务。代码见:https://github.com/jiawangbai/HAT。

关键词

引用

@article{arxiv.2204.00993,
  title  = {Improving Vision Transformers by Revisiting High-frequency Components},
  author = {Jiawang Bai and Li Yuan and Shu-Tao Xia and Shuicheng Yan and Zhifeng Li and Wei Liu},
  journal= {arXiv preprint arXiv:2204.00993},
  year   = {2022}
}

备注

Accepted to ECCV2022; Code: https://github.com/jiawangbai/HAT