对 ViT 抵御常见 corruptions 鲁棒性的深入洞察
计算机视觉与模式识别
2022-08-22 v3
摘要
随着视觉 Transformer(ViTs)在各种计算机视觉任务中取得重大进展,近期文献提出了多种 vanilla ViT 的变体以实现更好的效率与效果。然而,其独特架构如何影响对常见 corruptions 的鲁棒性仍不清楚。本文中,我们首次尝试探究 ViT 变体间的鲁棒性差距,并探索对鲁棒性至关重要的底层设计。通过广泛而严格的基准测试,我们表明简单的架构设计(如重叠块嵌入与卷积前馈网络(FFN))可提升 ViT 的鲁棒性。此外,由于 ViT 的训练严重依赖数据增强,先前针对鲁棒性目的的基于 CNN 的增强策略是否仍然有效值得研究。我们探索了 ViT 上的不同数据增强,并验证对抗噪声训练有效而傅里叶域增强较差。基于这些发现,我们引入了一种新颖的条件方法,根据输入图像生成动态增强参数,从而提供对常见 corruptions 的 state-of-the-art 鲁棒性。
引用
@article{arxiv.2204.12143,
title = {Deeper Insights into the Robustness of ViTs towards Common Corruptions},
author = {Rui Tian and Zuxuan Wu and Qi Dai and Han Hu and Yu-Gang Jiang},
journal= {arXiv preprint arXiv:2204.12143},
year = {2022}
}