中文

通过简单动态扫描增强提升视觉 Transformer 的鲁棒性

计算机视觉与模式识别 2023-11-02 v1 人工智能 机器学习

摘要

Vision Transformer (ViT) 已在计算机视觉任务中展现出与最先进神经网络相媲美的良好性能。然而,这类新型深度神经网络架构易受对抗攻击,限制了其鲁棒性方面的能力。本文提出一项新贡献,旨在进一步提升 ViT 的精度与鲁棒性,尤其在面对对抗攻击时。我们提出一种称为“动态扫描增强”(Dynamic Scanning Augmentation) 的增强技术,其利用动态输入序列自适应地聚焦于不同图像块,从而保持性能与鲁棒性。我们的详细研究表明,这种对输入序列的适应性即使对同一图像也会显著改变 ViT 的注意力机制。我们引入了动态扫描增强的四种变体,在对抗攻击鲁棒性和自然图像精度上均优于 ViT,其中一种变体结果相当。通过集成我们的增强技术,我们观察到 ViT 的鲁棒性大幅提升,在不同类型对抗攻击下由 17%17\% 提高到 92%92\%。这些发现连同其他全面测试表明,动态扫描增强通过促进更具适应性的注意力类型来增强精度与鲁棒性。总之,本工作通过引入动态扫描增强作为提升 ViT 精度与鲁棒性的技术,为视觉 Transformer 的持续研究做出贡献。观测结果凸显了该方法在推进计算机视觉任务中的潜力,值得在未来研究中进一步探索。

关键词

引用

@article{arxiv.2311.00441,
  title  = {Improving Robustness for Vision Transformer with a Simple Dynamic Scanning Augmentation},
  author = {Shashank Kotyan and Danilo Vasconcellos Vargas},
  journal= {arXiv preprint arXiv:2311.00441},
  year   = {2023}
}

备注

Accepted in Neurocomputing