中文

面向视觉语言预训练模型的高质量对抗攻击方法——HQA-VLAttack

计算机视觉与模式识别 2026-04-21 v1 人工智能

摘要

视觉语言预训练模型的对抗攻击是一种实用且具挑战性的任务,因为需要同时考虑文本和图像扰动,且仅能访问预测结果。该领域研究尚处于初阶段,仅有少数方法可用。然而,现有方法要么依赖复杂的迭代交叉搜索策略,导致大量查询消耗;要么仅考虑降低正面图像-文本配对相似度,却忽略了负面配对相似度的影响,这会间接影响攻击效果。为缓解上述问题,我们提出了一个简单而有效的框架,用于生成视觉语言预训练模型上的高质量对抗样本,称为HQA-VLAttack,包含文本和图像攻击两个阶段。文本扰动生成方面,利用反拟合词向量生成替代词集合,确保替代词与原词的语义一致性。图像扰动生成方面,首先通过基于层级重要性的策略初始化图像对抗样本,然后利用对比学习优化图像对抗扰动,确保正面图像-文本配对相似度降低,同时负面配对相似度增加。如此一来,优化后的对抗图像和文本更可能检索到负面样本,从而增强攻击成功率。在三个基准数据集上进行实验表明,HQA-VLAttack在攻击成功率方面显著优于强大基线方法。

关键词

引用

@article{arxiv.2604.16499,
  title  = {HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models},
  author = {Han Liu and Jiaqi Li and Zhi Xu and Xiaotong Zhang and Xiaoming Xu and Fenglong Ma and Yuanman Li and Hong Yu},
  journal= {arXiv preprint arXiv:2604.16499},
  year   = {2026}
}