表征脆弱性的机制理解与鲁棒 Vision Transformer 工程
计算机视觉与模式识别
2025-02-10 v1 机器学习
摘要
虽然基于 Transformer 的模型在 NLP 和视觉应用中占据主导地位,但其将输入空间语义映射到标签空间的底层机制尚未被充分理解。在本文中,我们研究了视觉 Transformer (ViT) 已知表征脆弱性的来源,即感知上相同的图像可能具有截然不同的表征,而语义上无关的图像可能具有相同的表征。我们的分析表明,输入的不可察觉变化可能导致显著的表征变化,尤其是在较后的层中,这表明 ViT 性能可能存在不稳定性。我们的全面研究揭示,对抗效应虽然在早期层中很微妙,但会通过网络传播和放大,在中后期层中变得最为明显。这一洞察推动了 NeuroShield-ViT 的开发,这是一种新颖的防御机制,它策略性地中和早期层中的脆弱神经元,以防止对抗效应的级联。我们展示了 NeuroShield-ViT 在各种攻击下的有效性,特别是在对抗强迭代攻击方面表现出色,并展示了其卓越的零样本泛化能力。在不进行微调的情况下,我们的方法在对抗样本上达到了 77.8% 的竞争性准确率,超越了传统的鲁棒性方法。我们的结果为对抗效应如何在 ViT 层中传播提供了新的见解,同时提供了一种有前景的方法来增强视觉 Transformer 对抗对抗攻击的鲁棒性。此外,它们还提供了一种有前景的方法来增强视觉 Transformer 对抗对抗攻击的鲁棒性。
引用
@article{arxiv.2502.04679,
title = {Mechanistic Understandings of Representation Vulnerabilities and Engineering Robust Vision Transformers},
author = {Chashi Mahiul Islam and Samuel Jacob Chacko and Mao Nishino and Xiuwen Liu},
journal= {arXiv preprint arXiv:2502.04679},
year = {2025}
}
备注
10 pages, 5 figures