利用合成生成视频评估视觉语言模型的情境与空间感知能力
计算机视觉与模式识别
2026-01-23 v1
摘要
视觉语言模型(VLM)中的空间推理在语义依赖于微妙的时间或几何线索时仍然脆弱。我们引入了一个合成基准测试,探测两种互补技能:情境感知(识别交互是有害还是良性)和空间感知(追踪谁对谁做了什么,并推理相对位置和运动)。通过最少的视频对,我们测试了三个挑战:区分暴力与良性活动、跨视角绑定攻击者角色,以及判断精细轨迹对齐。虽然我们在无训练设置下评估了近期VLM,但该基准适用于任何视频分类模型。结果显示各任务性能仅略高于随机水平。一个简单的辅助手段——稳定颜色线索——部分减少了攻击者角色混淆,但未能解决底层弱点。通过发布数据和代码,我们旨在提供可复现的诊断工具,并激发对轻量级空间先验的探索以补充大规模预训练。
引用
@article{arxiv.2601.15780,
title = {Assessing Situational and Spatial Awareness of VLMs with Synthetically Generated Video},
author = {Pascal Benschop and Justin Dauwels and Jan van Gemert},
journal= {arXiv preprint arXiv:2601.15780},
year = {2026}
}