RO-Bench:基于文本驱动的对抗性视频MMLMs大规模鲁棒性评估
计算机视觉与模式识别
2025-10-13 v1 人工智能
摘要
最近,多模态大语言模型(MLLMs)在 various video understanding tasks中展现出显著性能。然而,他们在面对被操控视频内容时的数据鲁棒性,尤其是面对动态分布外(OOD)对抗性视频测试集,仍基本未被探索。本文引入Ro-Bench,首个用于评估MLLMs在动态OD对抗性视频测试集上的性能的基准。Ro-Bench包含高质量、多样且在时间上相关的视频数据,通过编辑风格、物体、背景及其组合实现。我们评估了八个最新的视频MLLMs,发现当前模型在面对对抗性视频内容时表现显著下降。此外,我们证明了使用对抗性数据微调MLLMs可提升鲁棒性,在Ro-Bench上实现21.73%的性能提升,在MVBench数据集的20个任务上实现12.78%的改进。这些发现凸显了对抗性数据在增强MLLMs视频理解能力方面的有效性。代码和数据将在不久后发布。
引用
@article{arxiv.2510.08936,
title = {RO-Bench: Large-scale robustness evaluation of MLLMs with text-driven counterfactual videos},
author = {Zixi Yang and Jiapeng Li and Muxi Diao and Yinuo Jing and Kongming Liang},
journal= {arXiv preprint arXiv:2510.08936},
year = {2025}
}