中文

视频-based MLLM 对抗攻击的迁移性:一种跨模态图像到视频方法

计算机视觉与模式识别 2026-01-12 v4 密码学与安全 机器学习

摘要

视频型多模态大语言模型 (V-MLLM) 在视频文本多模态任务中显示出对对抗样本的脆弱性。然而,对未见模型的对抗视频迁移性——一种常见且实际的场景——尚未得到探讨。本文首次针对 V-MLLM 间的对抗视频样本迁移性开展调查。我们发现现有对抗攻击方法在 V-MLLM 的黑盒设置下面临严重限制,这归因于以下不足:(1) 在扰动视频特征方面缺乏普遍性;(2) 只关注稀疏关键帧;(3) 未能整合多模态信息。为此,本文提出一种图像到视频 MLLM (I2V-MLLM) 攻击。在 I2V-MLLM 中,我们利用图像型多模态大语言模型 (I-MLLM) 作为代理模型构建对抗视频样本。通过整合多模态交互和时空信息,以破坏潜在空间中的视频表示,提高对抗迁移性。此外,引入一种扰动传播技术,以处理不同未知帧抽样策略。实验结果表明,我们的方法能够生成在多个视频文本多模态任务上的 V-MLLM 间 exhibits strong transferability。与这些模型的白盒攻击相比,我们的黑盒攻击(使用 BLIP-2 作为代理模型)在 Zero-Shot VideoQA 任务上分别在 MSVD-QA 和 MSRVTT-QA 上的平均攻击成功率 (AASR) 分别达到 57.98% 和 58.26%,表现出竞争力。

关键词

引用

@article{arxiv.2501.01042,
  title  = {Transferability of Adversarial Attacks in Video-based MLLMs: A Cross-modal Image-to-Video Approach},
  author = {Linhao Huang and Xue Jiang and Zhiqiang Wang and Wentao Mo and Xi Xiao and Yong-Jie Yin and Bo Han and Feng Zheng},
  journal= {arXiv preprint arXiv:2501.01042},
  year   = {2026}
}