零样态对抗鲁棒性的补充文本引导注意力
计算机视觉与模式识别
2026-03-20 v1
摘要
由于预训练视觉语言模型(如 CLIP)的卓越零样态能力,已广泛应用于各个领域。然而,CLIP 被观察到对对抗样本高度敏感。通过实验分析,我们注意到,对抗扰动会引起文本引导注意力的偏移。基于此现象,我们提出一种简单而有效的策略:Text-Guided Attention for Zero-Shot Robustness(TGA-ZSR)。该框架包含两个组件:局部注意力细化模块和全局注意力约束模块。我们的目标是保持 CLIP 模型的泛化能力,同时增强其对抗鲁棒性。此外,全局注意力约束模块从干净样本中获取目标和原始模型的文本引导注意力,其目标是在保持干净样本性能的同时提升整体鲁棒性。然而,我们注意到该方法有时会关注无关或伪影特征,这可能导致次优性能并削弱其在特定情境下的鲁棒性。为克服这一局限,我们进一步提出一种称为补充文本引导注意力(Comp-TGA)的新方法。该方法整合了两种前景注意力:由类别提示引导的注意力和由非类别提示驱动的反转注意力。这种补充注意力机制允许模型捕获更全面和准确的前景表示。实验表明,TGA-ZSR 和 Comp-TGA 分别在 16 个数据集上的零样态鲁棒准确率提升了 9.58% 和 11.95%。
引用
@article{arxiv.2603.18598,
title = {Complementary Text-Guided Attention for Zero-Shot Adversarial Robustness},
author = {Lu Yu and Haiyang Zhang and Changsheng Xu},
journal= {arXiv preprint arXiv:2603.18598},
year = {2026}
}
备注
Accepted to TPAMI 2026. arXiv admin note: substantial text overlap with arXiv:2410.21802