理解视觉状态空间模型在图像分类中的鲁棒性
计算机视觉与模式识别
2024-03-19 v1
摘要
视觉状态空间模型(VMamba)最近作为一种具有前景的架构,在 various computer vision tasks 中展现出卓越的性能。然而,其鲁棒性尚未得到充分研究。本文通过从多个角度进行全面调查,深入探讨了该架构的鲁棒性。首先,我们研究了其对对抗性攻击的鲁棒性,采用整体图像和特定区域的对抗性攻击。结果表明,VMamba 在对抗性鲁棒性方面优于 Transformer 架构,但揭示了其可扩展性弱点。其次,评估了 VMamba 在多种情景下的通用鲁棒性,包括自然对抗样本、离分布数据和常见损坏。VMamba 在离分布数据方面表现出卓越的可解释性,但在自然对抗样本和常见损坏方面显示出可扩展性弱点。此外,我们探索了 VMamba 在白盒攻击期间的梯度和反向传播,揭示了其新型组件的独特漏洞和防御能力。最后,考察了 VMamba 对图像结构变化的灵敏度,突出了干扰区域分布和空间信息相关的脆弱性,靠近图像中心的区域更易受攻击。通过这些全面研究,我们为更深入地理解 VMamba 的鲁棒性贡献了宝贵的见解,为改进和发展计算机视觉应用中深度神经网络的能力提供了所谓。
引用
@article{arxiv.2403.10935,
title = {Understanding Robustness of Visual State Space Models for Image Classification},
author = {Chengbin Du and Yanxi Li and Chang Xu},
journal= {arXiv preprint arXiv:2403.10935},
year = {2024}
}
备注
27 pages