中文

MVTamperBench:评估视觉语言模型鲁棒性的基准

计算机视觉与模式识别 2025-06-12 v5

摘要

多模态大语言模型(MLLMs)是视觉语言模型(VLMs)的最新进展,推动了视频理解方面的重大进展。然而,这些模型对对抗性篡改和操纵的脆弱性仍未得到充分探讨。为填补这一空白,我们引入了 \textbf{MVTamperBench}——一个系统性评估 MLLM 针对五类常见篡改技术(旋转、遮挡、替换、重复和删除)鲁棒性的基准;基于现实世界的视觉篡改场景,如监控干扰、社交媒体内容编辑和虚假信息注入。MVTamperBench 包含约 3.4K 原创视频,扩展为超过 17K 条被篡改剪辑,覆盖 19 种不同的视频操作任务。该基准挑战模型检测在空间和时间一致性方面的篡改。我们评估了 45 个近期 MLLMs,来自 15+ 模型家族。我们揭示了不同篡改类型下韧性存在显著差异,同时表明参数规模更大并不一定保证鲁棒性。MVTamperBench 为在安全关键型应用中开发抗篡改 MLLM(如检测点击 bait、防止有害内容传播、执行媒体平台政策)设立了新基准。我们公开所有代码、数据和基准,以推动可信视频理解领域的开放性研究。代码:https://amitbcp.github.io/MVTamperBench/ 数据:https://huggingface.co/datasets/Srikant86/MVTamperBench

关键词

引用

@article{arxiv.2412.19794,
  title  = {MVTamperBench: Evaluating Robustness of Vision-Language Models},
  author = {Amit Agarwal and Srikant Panda and Angeline Charles and Bhargava Kumar and Hitesh Patel and Priyaranjan Pattnayak and Taki Hasan Rafi and Tejaswini Kumar and Hansa Meghwani and Karan Gupta and Dong-Kyu Chae},
  journal= {arXiv preprint arXiv:2412.19794},
  year   = {2025}
}