对比谱域校正:面向 CLIP 零样本对抗鲁棒性的测试时防御
计算机视觉与模式识别
2026-01-28 v1
摘要
视觉-语言模型(VLMs),如 CLIP,已展现出卓越的零样本泛化能力,但仍极易受到对抗样本(AEs)的攻击。虽然测试时防御方法很有前景,但现有方法无法提供足够强的鲁棒性来抵御强力攻击,并且常常受到高推理延迟和任务特定适用性的阻碍。为了解决这些局限性,我们首先研究了 AEs 的内在属性,揭示了 AEs 在渐进式频率衰减下表现出严重的特征不一致性。我们进一步将此归因于模型固有的频谱偏差。利用这一洞察,我们提出了一种高效的测试时防御方法,名为对比谱校正(CSR)。CSR 在频谱引导的对比目标下优化一个校正扰动,以将输入重新对齐到自然流形上,该扰动是输入自适应的。在 16 个分类基准上的广泛实验表明,CSR 在抵御强 AutoAttack 攻击时,平均性能比 SOTA 高出 18.1%,且推理开销适中。此外,CSR 在各种视觉任务中展现出广泛的适用性。代码可在 https://github.com/Summu77/CSR 获取。
引用
@article{arxiv.2601.19210,
title = {Contrastive Spectral Rectification: Test-Time Defense towards Zero-shot Adversarial Robustness of CLIP},
author = {Sen Nie and Jie Zhang and Zhuo Wang and Shiguang Shan and Xilin Chen},
journal= {arXiv preprint arXiv:2601.19210},
year = {2026}
}
备注
21 pages