中文

面向 CLIP 的语义感知对抗微调

计算机视觉与模式识别 2026-02-16 v1

摘要

最近的研究表明,CLIP 模型在零射时分类任务中的对抗鲁棒性可以通过对其图像编码器进行对抗微调来提升,这类对抗样本通过最小化图像与手工模板(如 "A photo of a {label}")之间的余弦相似度来生成。然而,已证明图像与单一手工模板之间的余弦相似度不足以衡量图像-文本对的相似度。基于此,在本文中,我们发现即使替换相似度度量标准为语义丰富的替代方案,生成的对抗样本也可能难以欺骗 CLIP,从而导致经这些对抗样本微调的图像编码器鲁棒性较差。为此,我们首先提出一种语义集合攻击,通过最小化原始图像与一组精炼文本描述的平均相似度来生成语义感知对抗样本。这些描述最初由基础模型生成,以捕获手工模板之外的核心语义特征,随后进行精炼以减少幻觉现象。基于此,我们提出语义感知对抗微调 (SAFT) 方法,对 CLIP 的图像编码器进行微调。大量实验表明,SAFT 在 16 个数据集上优于当前方法,显著提升了零射时对抗鲁棒性。我们的代码已公开:https://github.com/tmlr-group/SAFT。

关键词

引用

@article{arxiv.2602.12461,
  title  = {Semantic-aware Adversarial Fine-tuning for CLIP},
  author = {Jiacheng Zhang and Jinhao Li and Hanxun Huang and Sarah M. Erfani and Benjamin I. P. Rubinstein and Feng Liu},
  journal= {arXiv preprint arXiv:2602.12461},
  year   = {2026}
}