AGC:面向视觉-语言模型对抗鲁棒性的自适应测地线校正
计算机视觉与模式识别
2026-05-18 v1
摘要
像CLIP这样的视觉-语言模型已展现出卓越的零样本迁移能力。然而,它们对难以察觉的对抗性扰动的敏感性仍然是一个关键的安全问题。虽然测试时防御为已部署的模型提供了一种实用的解决方案,但现有方法通常依赖推理过程中的基于梯度的优化,导致显著的计算开销。在本文中,我们重新审视了数据增强在CLIP鲁棒性中的作用,并观察到增强并非同等有效:特定的增强能持续提供鲁棒的几何线索,这些线索在超球面特征空间中与正确的类别语义对齐。基于此,我们提出了自适应地应线校正(AGC),这是一种无需训练的防御机制,无需参数更新。AGC识别出一个可靠的增强作为几何锚点,并将输入特征向其校正,利用自适应步长来平衡鲁棒性与干净样本准确率的保持。AGC在八个细粒度数据集和三个CLIP骨干网络上实现了卓越的性能,与最先进的基线相比,平均鲁棒准确率提高了44.4%,同时推理延迟降低了10倍。我们的发现揭示了CLIP特征的一个基本几何属性,为鲁棒的多模态部署提供了一个高效且有效的范式。
引用
@article{arxiv.2605.15584,
title = {AGC: Adaptive Geodesic Correction for Adversarial Robustness on Vision-Language Models},
author = {Zhiwei Li and Jiacheng Xue and Weining Wang and Ajian Liu and Xingyu Gao and Zhenan Sun and Qi Li},
journal= {arXiv preprint arXiv:2605.15584},
year = {2026}
}