中文

REVEAL:揭示视频语言模型脆弱的时空与视觉定位

计算机视觉与模式识别 2026-02-13 v1

摘要

本工作探讨了一个根本问题:视频语言模型(VidLMs)是否稳健地考虑视频内容、时序序列和运动?我们的调查显示,这些模型往往并不做到。我们引入REVEAL{}诊断基准,通过五个受控压力测试揭示当代VidLMs的根本弱点:评估时序期望偏差、语言捷径依赖、视频奉承、摄像机运动敏感性以及对时空遮挡的鲁棒性。我们测试了领先的开源和闭源VidLMs,发现这些模型会自信地将逆转场景描述为正向场景,回答问题时忽略视频内容,认同错误的主张,在基本摄像机运动下困难应对,面对简单时空遮挡时无法整合时序信息。相比之下,人类在这些任务上都能轻松取得成功。我们随基准发布数据管道,自动生成诊断性示例,支持更广泛且更可扩展的评估。我们将公开基准数据集和代码,以支持后续研究。

关键词

引用

@article{arxiv.2602.11244,
  title  = {Stress Tests REVEAL Fragile Temporal and Visual Grounding in Video-Language Models},
  author = {Sethuraman T and Savya Khosla and Aditi Tiwari and Vidya Ganesh and Rakshana Jayaprakash and Aditya Jain and Vignesh Srinivasakumar and Onkar Kishor Susladkar and Srinidhi Sunkara and Aditya Shanmugham and Rakesh Vaideeswaran and Abbaas Alif Mohamed Nishar and Simon Jenni and Derek Hoiem},
  journal= {arXiv preprint arXiv:2602.11244},
  year   = {2026}
}