中文

Know-Show:面向时空定位推理的视频语言模型基准测试

计算机视觉与模式识别 2026-04-01 v3

摘要

大型视频语言模型(Video-LMs)在多模态理解方面取得了显著进展,但其推理仍缺乏对空间和时间的扎实 grounding。我们提出 Know-Show,一个新的基准测试,旨在评估时空扎实推理能力,即模型在推理时如何同时在视觉和时间证据上进行 grounding。Know-Show 将推理与定位统一于一个包含五个互补场景的评估框架中,这些场景覆盖空间(人、物体、人体-物体、手-物体)和时间维度。基于 Charades、Action Genome 和 Ego4D 构建,包含 2500 份高质量人工编写的问题,揭示了当前 Video-LMs 与人类推理之间的显著差距。为弥合这一差距,我们提出 GRAM,一个无需监督训练的插件,通过注意力机制的视频 token 选择和显式时间戳编码,为 Video-LMs 增添细粒度扎实推理能力。广泛实验表明,现有模型在“展示所知”和“显示所知”方面均表现不佳。Know-Show 为评估视频语言理解中的扎实推理 establish 了统一标准,并为开发可解释且可靠的多模态推理系统提供了洞见。我们已在 https://github.com/LUNAProject22/Know-Show 上发布数据集,代码也将在同一仓库中发布。

关键词

引用

@article{arxiv.2512.05513,
  title  = {Know-Show: Benchmarking Video-Language Models on Spatio-Temporal Grounded Reasoning},
  author = {Chinthani Sugandhika and Chen Li and Deepu Rajan and Basura Fernando},
  journal= {arXiv preprint arXiv:2512.05513},
  year   = {2026}
}