Video-MSR:多模态大语言模型多跳空间推理能力基准测试
计算机视觉与模式识别
2026-01-15 v1
摘要
空间推理已成为多模态大语言模型 (MLLMs) 的一项关键能力,引起了越来越多的关注和快速发展。然而,现有的基准测试主要侧重于单步感知到判断的任务,使得需要复杂视觉-空间逻辑链的场景在很大程度上未被充分探索。为了弥补这一差距,我们引入了 Video-MSR,这是第一个专门设计用于评估动态视频场景中多跳空间推理 (MSR) 的基准测试。Video-MSR 通过四个不同的任务系统地探测 MSR 能力:约束定位、基于链的参考检索、路径规划和反事实物理推演。我们的基准测试包含 3,052 个高质量视频实例和 4,993 个问答对,通过结合先进模型生成与严格人工验证的可扩展、视觉基础化流程构建而成。通过对 20 个最先进的 MLLMs 的全面评估,我们发现了显著的局限性,表明虽然模型在表层感知上表现出色,但在 MSR 任务中表现出明显的性能下降,在多步推演中经常出现空间迷失和幻觉。为了缓解这些缺陷并赋予模型更强的 MSR 能力,我们进一步整理了 MSR-9K 这一专门的指令微调数据集,并对 Qwen-VL 进行了微调,在 Video-MSR 上实现了 +7.82% 的绝对提升。我们的结果强调了多跳空间指令数据的有效性,并将 Video-MSR 确立为未来研究的重要基础。代码和数据将发布于 https://github.com/ruiz-nju/Video-MSR。
引用
@article{arxiv.2601.09430,
title = {Video-MSR: Benchmarking Multi-hop Spatial Reasoning Capabilities of MLLMs},
author = {Rui Zhu and Xin Shen and Shuchen Wu and Chenxi Miao and Xin Yu and Yang Li and Weikang Li and Deguo Xia and Jizhou Huang},
journal= {arXiv preprint arXiv:2601.09430},
year = {2026}
}