视频大语言模型中的弹出式干扰揭示事件包行为
计算机视觉与模式识别
2026-05-27 v1 计算与语言
摘要
链接视频中主体与事件的时间关系是视频理解的关键能力,但视频大语言模型(VideoLLMs)是否实现了这一能力尚不明确。本文引入DistractionBench来评估VideoLLMs在存在无关视频片段时能否稳健地将主体与事件关联。通过控制性干预(如插入短暂的广告片段至长视频中),我们表明VideoLLMs经常在不同片段之间产生幻觉交互,错误地将注入广告的动作归因于主视频中的主体。我们将这种系统性幻觉 characterize 为事件包(bag-of-events, BoE)行为,即模型将视频处理为事件的集合而非时序结构化序列。评估了11个流行VideoLLMs,发现所有模型都表现出显著的BoE行为。我们的发现表明VideoLLMs缺乏可靠的时序 grounding机制,动力学开发更具鲁棒性的主体-事件关联模型。
引用
@article{arxiv.2605.27101,
title = {Pop-Up Distractions Reveal Bag-of-Events Behavior in Video Large Language Models},
author = {Oscar Chew and Serhii Honcharenko and Qian-Hui Chen and Patricia Lu and Dishant Zaveri and Khoa D. Doan and Kuan-Hao Huang},
journal= {arXiv preprint arXiv:2605.27101},
year = {2026}
}