NAP-Tuning:面向对抗鲁棒视觉语言模型的神经增强提示调优
计算机视觉与模式识别
2026-02-03 v2 人工智能
摘要
视觉语言模型(VLM)如 CLIP 已在通过联合嵌入空间理解视觉与文本数据之间的关系方面展现出卓越的能力。尽管如此,这些模型仍对对抗攻击十分敏感,尤其在图像模态下,引发了重大的安全顾虑。基于我们先前关于对抗提示调优(AdvPT)的工作——该方法通过可学习的文本提示提升视觉语言模型的对抗鲁棒性,而无需进行大量参数训练——我们在此提出了显著的扩展:引入用于多模态对抗提示调优(NAP-Tuning)的神经增强器框架。我们的关键创新包括:(1)将 AdvPT 从文本单模态扩展至文本与视觉模态的多模态提示;(2)从单层提示架构扩展至多层提示架构;(3)提出一种通过神经增强器实现的架构级重新设计,采用特征净化直接针对对抗攻击在特征空间引入的扭曲进行处理。我们的 NAP-Tuning 方法包含可学习通过残差连接重建净化特征的 token 细化器,允许实现模态特定和层特定的特征校正。综合实验表明,NAP-Tuning 在各种数据集和攻击类型下均显著优于现有方法。值得注意的是,在具有挑战性的 AutoAttack 框架下,我们的方法在 ViT-B16 和 ViT-B32 架构上分别超过最强基线 33.5% 和 33.0%,同时保持竞争的干净准确率。
引用
@article{arxiv.2506.12706,
title = {NAP-Tuning: Neural Augmented Prompt Tuning for Adversarially Robust Vision-Language Models},
author = {Jiaming Zhang and Xin Wang and Xingjun Ma and Lingyu Qiu and Yu-Gang Jiang and Jitao Sang},
journal= {arXiv preprint arXiv:2506.12706},
year = {2026}
}