中文

针对视频多模态大语言模型对抗攻击的大规模生成框架 CAVALRY-V

机器人学 2025-07-02 v1 人工智能

摘要

视频多模态大语言模型 (V-MLLMs) 在时序推理和跨模态理解方面展现出惊人的能力,但其对对抗攻击的脆弱性却鲜有探讨,原因在于独特的挑战:复杂的跨模态推理机制、时序依赖性和计算限制。我们提出 CAVALRY-V (Cross-modal Language-Vision Adversarial Yielding for Videos),一个直接针对 V-MLLMs 中视觉感知与语言生成关键接口的新框架。我们的 метод引入两个关键创新:(1) 双目标语义-视觉损失函数同时干扰模型的文本生成 logits 和视觉表示以破坏跨模态集成,(2) 计算高效的两阶段生成框架,将大规模预训练用于跨模型可迁移性,结合专门的微调用于时空一致性。对全面视频理解基准的实证评估表明,CAVALRY-V 在现有攻击方法中显著优于,无论是商业系统 (GPT-4.1、Gemini 2.0) 还是开源模型 (QwenVL-2.5、InternVL-2.5、Llava-Video、Aria、MiniCPM-o-2.6) 的平均提升达 22.8%。该框架通过隐式时序一致性建模而非显式正则化实现灵活性,使其即使在图像理解上也能实现显著性能提升 (平均提升 34.4%)。这一能力表明 CAVALRY-V 作为跨模态系统对抗研究的基础方法具有潜力。

关键词

引用

@article{arxiv.2507.00816,
  title  = {PI-WAN: A Physics-Informed Wind-Adaptive Network for Quadrotor Dynamics Prediction in Unknown Environments},
  author = {Mengyun Wang and Bo Wang and Yifeng Niu and Chang Wang},
  journal= {arXiv preprint arXiv:2507.00816},
  year   = {2025}
}