中文

时间盲视:视频语言模型为何无法看到人类所见?

计算机视觉与模式识别 2026-04-30 v2 人工智能

摘要

视觉语言模型 (VLMs) 的最新进展在理解视频中的时空关系方面取得了令人瞩目的进展。然而,当空间信息被掩盖时,这些模型难以捕捉纯时序模式。我们引入了 SpookyBench\textbf{SpookyBench},这是一个信息仅编码在类噪声帧的时序序列中的基准,反映了从生物信号到隐蔽通信的自然现象。有趣的是,虽然人类能以超过 98% 的准确率识别这些序列中的形状、文本和图案,但最先进的 VLMs 准确率为 0%。这种性能差距凸显了一个关键局限:过度依赖帧级空间特征,且无法从时序线索中提取含义。此外,当在空间信噪比 (SNR) 较低的数据集中训练时,模型的时序理解能力比人类感知退化得更快,尤其是在需要细粒度时序推理的任务中。克服这一局限将需要解耦空间依赖与时序处理的新颖架构或训练范式。我们的系统分析表明,该问题在不同模型规模和架构中均持续存在。我们发布了 SpookyBench,以促进时序模式识别的研究,并弥合人类与机器视频理解之间的差距。数据集和代码已在我们的项目网站上公开:https://timeblindness.github.io/。

关键词

引用

@article{arxiv.2505.24867,
  title  = {Time Blindness: Why Video-Language Models Can't See What Humans Can?},
  author = {Ujjwal Upadhyay and Mukul Ranjan and Zhiqiang Shen and Mohamed Elhoseiny},
  journal= {arXiv preprint arXiv:2505.24867},
  year   = {2026}
}

备注

Accepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026 Project page at https://timeblindness.github.io