通过基于图像块的负增强理解并提升视觉Transformer的鲁棒性
机器学习
2023-02-23 v2 计算机视觉与模式识别
摘要
我们通过视觉Transformer(ViTs)特有的基于图像块的架构结构(即将图像作为图像块序列进行处理)来研究其鲁棒性。我们发现,ViTs对基于图像块的变换表现出惊人的不敏感性,即使这种变换在很大程度上破坏了原始语义,使图像无法被人类识别。这表明ViTs大量使用了在此类变换中幸存但对人类而言通常不指示语义类别的特征。进一步研究表明,这些特征有用但不鲁棒,因为基于它们训练的ViTs可以在分布内达到高准确率,但在分布偏移下会失效。基于这一理解,我们提出一个问题:训练模型减少对这些特征的依赖能否提高ViTs的鲁棒性和分布外性能?我们使用经过基于图像块操作变换的图像作为负增强视图,并提供损失函数来正则化训练,使其远离使用非鲁棒特征。这与现有研究形成互补,现有研究大多侧重于使用保持语义的变换来增强输入,以强制模型的不变性。我们证明,基于图像块的负增强在广泛的基于ImageNet的鲁棒性基准测试中持续提升了ViTs的鲁棒性。此外,我们发现基于图像块的负增强与传统的(正)数据增强是互补的,两者结合可进一步提升性能。
引用
@article{arxiv.2110.07858,
title = {Understanding and Improving Robustness of Vision Transformers through Patch-based Negative Augmentation},
author = {Yao Qin and Chiyuan Zhang and Ting Chen and Balaji Lakshminarayanan and Alex Beutel and Xuezhi Wang},
journal= {arXiv preprint arXiv:2110.07858},
year = {2023}
}
备注
Accepted to NeurIPS-2022