中文

TimeBlind:用于视频大语言模型的时空组合性基准

计算机视觉与模式识别 2026-02-26 v3 人工智能

摘要

细粒度的时空理解是视频推理和具身智能的关键。然而,尽管多模态大语言模型(MLLMs)在静态语义方面大显身手,其对时序动态的把握仍显脆弱。我们提出TimeBlind,一个用于时空组合理解的诊断性基准。灵感来自认知科学,TimeBlind将细粒度时序理解分为三个层次:识别原子事件、刻画事件属性、推理事件相互依赖。不同于那些混合识别与时序推理的基准,TimeBlind采用最小配对范例:视频对在静态视觉内容上完全相同,仅在时序结构上存在差异,利用互补问题中立化语言偏置。评估超过20个最先进MLLMs(如GPT-5、Gemini 3 Pro)在600个精选实例(2400个视频-问题对)上的表现,发现最佳MLLM的实例准确率(正确区分两个视频)仅为48.2%,远低于人类水平(98.2%)。这些结果表明,即便是前沿模型也严重依赖静态视觉捷径而非真正的时序逻辑,使TimeBlind成为下一代视频理解的关键诊断工具。数据集和代码已公开于 https://baiqi-li.github.io/timeblind_project/。

关键词

引用

@article{arxiv.2602.00288,
  title  = {TimeBlind: A Spatio-Temporal Compositionality Benchmark for Video LLMs},
  author = {Baiqi Li and Kangyi Zhao and Ce Zhang and Chancharik Mitra and Jean de Dieu Nyandwi and Gedas Bertasius},
  journal= {arXiv preprint arXiv:2602.00288},
  year   = {2026}
}

备注

For code and data, see https://baiqi-li.github.io/timeblind_project/