中文

重访 CroPA:视觉语言模型中跨提示对抗可迁移性的可复现性研究与增强

计算机视觉与模式识别 2026-05-04 v1

摘要

大型视觉语言模型(VLMs)已彻底改变了计算机视觉领域,使图像分类、图像描述生成和视觉问答等任务成为可能。然而,它们仍然极易受到对抗攻击的影响,尤其是在视觉和文本两种模态都可能被操纵的场景中。在本研究中,我们对《一张图像价值千句谎言:视觉语言模型上跨提示的对抗可迁移性》进行了全面的可复现性研究,验证了跨提示攻击(CroPA),并确认其相较于现有基线方法具有更优越的跨提示可迁移性。除复现之外,我们提出了若干关键改进:(1) 一种显著提升攻击成功率(ASR)的新型初始化策略。(2) 通过学习通用扰动来研究跨图像可迁移性。(3) 一种针对视觉编码器注意力机制的新型损失函数,以提升泛化能力。我们在主流 VLMs(包括 Flamingo、BLIP-2 和 InstructBLIP)以及在 LLaVA 上的扩展实验上进行了评估,验证了原始结果,并证明我们的改进能够持续提升对抗有效性。我们的工作强调了研究 VLMs 对抗脆弱性的重要性,并提供了一个更稳健的框架来生成可迁移的对抗样本,对理解 VLMs 在实际应用中的安全性具有重要意义。

关键词

引用

@article{arxiv.2506.22982,
  title  = {Revisiting CroPA: A Reproducibility Study and Enhancements for Cross-Prompt Adversarial Transferability in Vision-Language Models},
  author = {Atharv Mittal and Agam Pandey and Amritanshu Tiwari and Sukrit Jindal and Swadesh Swain},
  journal= {arXiv preprint arXiv:2506.22982},
  year   = {2026}
}

备注

Accepted to MLRC 2025