中文

金字塔对抗训练提升 ViT 性能

计算机视觉与模式识别 2022-09-07 v2

摘要

激进的数据增强是视觉Transformer(ViT)强泛化能力的关键组成部分。其中一种数据增强技术是对抗训练(AT);然而,许多先前工作表明这常导致干净的准确率不佳。本工作中,我们提出金字塔对抗训练(PyramidAT),一种简单有效的技术以提升 ViT 的整体性能。我们将其与“匹配”的 Dropout 和随机深度正则化配对,即对干净样本与对抗样本采用相同的 Dropout 和随机深度配置。类似于 AdvProp 对 CNN 的改进(不直接适用于 ViT),我们的金字塔对抗训练打破了 ViT 及相关架构的分布内准确率与分布外鲁棒性之间的权衡。当仅在 ImageNet-1K 数据上训练时,它使 ViT-B 模型在 ImageNet 干净准确率上绝对提升 1.82%,同时将在 7 个 ImageNet 鲁棒性指标上的性能绝对提升 1.76% 至 15.68%。仅使用 ViT-B/16 骨干与我们的金字塔对抗训练,我们为 ImageNet-C (41.42 mCE)、ImageNet-R (53.92%) 和 ImageNet-Sketch (41.04%) 设立了新的最先进水平,无需额外数据。我们的代码公开于 pyramidat.github.io。

关键词

引用

@article{arxiv.2111.15121,
  title  = {Pyramid Adversarial Training Improves ViT Performance},
  author = {Charles Herrmann and Kyle Sargent and Lu Jiang and Ramin Zabih and Huiwen Chang and Ce Liu and Dilip Krishnan and Deqing Sun},
  journal= {arXiv preprint arXiv:2111.15121},
  year   = {2022}
}

备注

Accepted to CVPR22 (oral, best paper finalist). 33 pages, including references & supplementary material