重新审视对抗性提示微调的鲁棒泛化
计算机视觉与模式识别
2024-05-21 v1 人工智能
摘要
理解像CLIP这样的大规模预训练视觉-语言模型对抗攻击的脆弱性,是确保其在各种下游任务上具有零样本泛化能力的关键。最先进的防御机制通常采用提示学习策略进行对抗性微调,以提高预训练模型的对抗鲁棒性,同时保持适应下游任务的效率。这种设置导致了过拟合问题,阻碍了模型在干净样本和对抗样本上泛化能力的进一步提升。在这项工作中,我们提出了一种自适应一致性引导的对抗性提示微调(即CAPT)框架,该框架利用多模态提示学习来增强对抗样本的图像和文本特征对齐,并利用预训练CLIP的强大泛化能力来指导模型——增强其在对抗样本上的鲁棒泛化,同时保持其在干净样本上的准确性。我们还设计了一个新颖的自适应一致性目标函数,以平衡微调模型和预训练模型之间对抗输入和干净输入的一致性。我们在14个数据集和4种数据稀疏方案(从1-shot到全训练数据设置)上进行了广泛实验,以展示CAPT相对于其他最先进自适应方法的优越性。CAPT在分布内性能以及输入分布偏移和跨数据集泛化方面表现出色。
引用
@article{arxiv.2405.11154,
title = {Revisiting the Robust Generalization of Adversarial Prompt Tuning},
author = {Fan Yang and Mingxuan Xia and Sangzhou Xia and Chicheng Ma and Hui Hui},
journal= {arXiv preprint arXiv:2405.11154},
year = {2024}
}