中文

视觉语言模型能否解答壳游戏?

计算机视觉与模式识别 2026-03-10 v1 计算与语言

摘要

视觉实体跟踪是人类天生的认知能力,然而它仍然是视觉-语言模型(VLMs)的关键瓶颈。这一缺陷往往被现有视频基准测试中的视觉捷径所掩盖。我们引入VET-Bench,一个包含视觉上相同物体的合成诊断测试基准,要求仅通过时空连续性来进行跟踪。我们的实验显示,当前的SOTA VLMs在VET-Bench上的表现达到或接近随机水平,这暴露了一种根本性的局限性:过度依赖静态帧级特征,以及在时间上维持实体表示的失败。我们提供了理论分析,揭示了与状态跟踪问题的联系,证明固定深度的基于变压器的VLMs在没有中间监督的情况下在跟踪无区别的物体方面存在根本性限制。为了解决这一问题,我们提出了时空 grounding 链式思考(SGCoT):生成物体轨迹作为显式的中间状态。利用Molmo2的物体跟踪能力,我们通过在合成的仅文本数据上进行微调来激发SGCoT推理。我们的方法在VET-Bench上实现了超过90%的SOTA准确率,表明VLMs能够在没有外部工具的情况下可靠地解决视频壳游戏任务。我们的代码和数据可在 https://vetbench.github.io 获取。

关键词

引用

@article{arxiv.2603.08436,
  title  = {Can Vision-Language Models Solve the Shell Game?},
  author = {Tiedong Liu and Wee Sun Lee},
  journal= {arXiv preprint arXiv:2603.08436},
  year   = {2026}
}