Watch, Listen, Understand, Mislead: 短视频内容适当性评估的三模态对抗攻击
计算机视觉与模式识别
2025-07-17 v1
摘要
多模态大语言模型(MLLMs)越来越多地用于内容 moderation,但其在短视频语境下的鲁棒性仍未得到充分探索。当前的安全评估通常依赖单模态攻击,无法解决组合攻击的脆弱性。在本文中,我们提出了一个全面的框架,用于评估MLLMs的三模态安全。首先,我们呈现了Short-Video Multimodal Adversarial(SVMA)数据集,包含多样化的短视频及其人工引导的合成对抗攻击。其次,我们提出了ChimeraBreak,这是一种新的三模态攻击策略,同时挑战视觉、听觉和语义推理路径。针对最先进的MLLMs进行大量实验,揭示了具有高攻击成功率(ASR)的显著脆弱性。我们的发现揭示了不同的失败模式,显示模型倾向于将良性或违反政策的内容误分类。我们使用LLM-as-a-judge进行评估,证明了攻击推理的有效性。我们的数据集和发现为开发更健壮和安全的MLLMs提供了至关重要的见解。
引用
@article{arxiv.2507.11968,
title = {Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation},
author = {Sahid Hossain Mustakim and S M Jishanul Islam and Ummay Maria Muna and Montasir Chowdhury and Mohammed Jawwadul Islam and Sadia Ahmmed and Tashfia Sikder and Syed Tasdid Azam Dhrubo and Swakkhar Shatabda},
journal= {arXiv preprint arXiv:2507.11968},
year = {2025}
}
备注
Accepted as long paper, SVU Workshop at ICCV 2025