中文

面向视觉语言预训练模型的样本无关对抗扰动

计算机视觉与模式识别 2024-08-07 v1

摘要

近期人工智能安全研究揭示了视觉语言预训练(VLP)模型对图像与文本中细微且有意设计扰动的脆弱性。通过对抗攻击探索多模态系统的鲁棒性在该领域至关重要。大多数多模态攻击针对单个样本,为每个样本生成唯一的扰动以构建对抗样本。据我们所知,首次通过多模态决策边界探索创建适用于任何图像的通用、样本无关扰动。首先,我们探索将样本点移出线性分类器决策边界的策略,优化算法以确保在 top kk 准确率指标下实现成功攻击。基于此基础,在视觉语言任务中,我们将视觉与文本模态视为互惠的样本点与决策超平面,引导图像嵌入遍历文本构建的决策边界,反之亦然。该迭代过程持续细化通用扰动,最终识别出输入空间中单一可被利用的方向,以损害 VLP 模型的检索性能。所提出算法支持创建全局扰动或对抗性补丁。全面实验验证了本方法的有效性,展示了其在各种 VLP 模型与数据集上的数据、任务与模型可迁移性。

关键词

引用

@article{arxiv.2408.02980,
  title  = {Sample-agnostic Adversarial Perturbation for Vision-Language Pre-training Models},
  author = {Haonan Zheng and Wen Jiang and Xinyang Deng and Wenrui Li},
  journal= {arXiv preprint arXiv:2408.02980},
  year   = {2024}
}

备注

13 pages, 8 figures, published in ACMMM2024