面向视频多模态大语言模型的对抗攻击大规模生成框架:CAVALRY-V
计算机视觉与模式识别
2025-07-02 v1 人工智能
摘要
视频多模态大语言模型(V-MLLMs)在时序推理和跨模态理解方面展现出惊人的能力,但由于独特挑战(复杂的跨模态推理机制、时序依赖性和计算约束),其对对抗攻击的脆弱性尚未得到充分探索。我们提出 CAVALRY-V(Cross-modal Language-Vision Adversarial Yielding for Videos),一个直接针对V-MLLMs视觉感知与语言生成关键接口的新型框架。我们的ethods引入两个关键创新:(1)一种双目标语义-视觉损失函数,同时干扰模型的文本生成logits和视觉表示以破坏跨模态集成;(2)一种计算高效的两阶段生成器框架,将大规模预训练用于跨模型可迁移性,结合专门的微调用于时空一致性。经验评估表明,CAVALRY-V在全面的视频理解基准测试中显著优于现有攻击方法,在商业系统(GPT-4.1、Gemini 2.0)和开源模型(QwenVL-2.5、InternVL-2.5、Llava-Video、Aria、MiniCPM-o-2.6)上平均提升22.8%。本框架通过隐式时序一致性建模实现灵活性,而非显式正则化,使其即使在图像理解任务上也能实现显著性能提升(平均提升34.4%)。这一能力表明CAVALRY-V作为跨模态系统对抗研究的基础方法具有巨大的潜力。
引用
@article{arxiv.2507.00817,
title = {CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs},
author = {Jiaming Zhang and Rui Hu and Qing Guo and Wei Yang Bryan Lim},
journal= {arXiv preprint arXiv:2507.00817},
year = {2025}
}