中文

Watch, Listen, Understand, Mislead: 短视频内容适当性评估的三模态对抗攻击

计算机视觉与模式识别 2025-07-17 v1

摘要

多模态大语言模型(MLLMs)越来越多地用于内容 moderation,但其在短视频语境下的鲁棒性仍未得到充分探索。当前的安全评估通常依赖单模态攻击,无法解决组合攻击的脆弱性。在本文中,我们提出了一个全面的框架,用于评估MLLMs的三模态安全。首先,我们呈现了Short-Video Multimodal Adversarial(SVMA)数据集,包含多样化的短视频及其人工引导的合成对抗攻击。其次,我们提出了ChimeraBreak,这是一种新的三模态攻击策略,同时挑战视觉、听觉和语义推理路径。针对最先进的MLLMs进行大量实验,揭示了具有高攻击成功率(ASR)的显著脆弱性。我们的发现揭示了不同的失败模式,显示模型倾向于将良性或违反政策的内容误分类。我们使用LLM-as-a-judge进行评估,证明了攻击推理的有效性。我们的数据集和发现为开发更健壮和安全的MLLMs提供了至关重要的见解。

关键词

引用

@article{arxiv.2507.11968,
  title  = {Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation},
  author = {Sahid Hossain Mustakim and S M Jishanul Islam and Ummay Maria Muna and Montasir Chowdhury and Mohammed Jawwadul Islam and Sadia Ahmmed and Tashfia Sikder and Syed Tasdid Azam Dhrubo and Swakkhar Shatabda},
  journal= {arXiv preprint arXiv:2507.11968},
  year   = {2025}
}

备注

Accepted as long paper, SVU Workshop at ICCV 2025