视频草堆中的两根因果相关针
计算机视觉与模式识别
2025-11-07 v3 人工智能
摘要
正确评估视频语言模型理解长视频的能力仍是一项挑战。我们提出了一个长上下文视频理解基准 Causal2Needles,用于评估现有基准未能充分解决的两项关键能力:(1)从长视频中两个独立位置(两根针)提取信息并联合理解它们;(2)以因果关系对人类行为进行世界建模。Causal2Needles 使用非因果单针、因果单针和因果双针问题来评估这些能力。最复杂的问题类型,即因果双针问题,要求从长视频及相关叙述文本中提取原因和结果事件的信息。为防止文本偏差,我们引入了两种互补的问题格式:定位包含答案的视频片段,以及对视频片段中视觉细节的文本描述。我们的实验表明,在现有基准上表现优异的模型在因果双针问题上表现挣扎,且模型性能与两根针之间的距离呈负相关。这些发现突显了当前 VLM 的关键局限性。数据集可在以下地址获取:https://huggingface.co/datasets/causal2needles/Causal2Needles
引用
@article{arxiv.2505.19853,
title = {Two Causally Related Needles in a Video Haystack},
author = {Miaoyu Li and Qin Chao and Boyang Li},
journal= {arXiv preprint arXiv:2505.19853},
year = {2025}
}
备注
Accepted to NeurIPS 2025 D&B Track