多模态大语言模型是否已就绪用于全向空间推理?
计算机视觉与模式识别
2025-05-20 v1
摘要
180×360 全向视野由 360 度摄像机捕获,使其可用于具身 AI 和虚拟现实等广泛的应用领域。尽管近期在多模态大语言模型(MLLM)方面的进展在视觉空间推理方面显示出前景,但大多数研究聚焦于标准针孔视角图像,全向感知仍鲜有探索。本文提出核心问题:MLLM 是否已就绪用于全向空间推理?为此,我们引入 OSR-Bench,这是首个专为此场景设计的基准测试。OSR-Bench 包含超过 153,000 组多样化问答对,基于高保真全景室内场景图构建。其涵盖对象计数、相对距离和方向等关键推理类型。我们还提出了负采样策略,将不存在的物体插入提示中,以评估幻觉和 grounding 鲁棒性。为进行细粒度分析,我们设计了两阶段评估框架,运用 rotation-invariant matching 以及基于规则和基于 LLM 的指标,评估认知地图生成与问答准确性。我们在零样本设置下评估了八个最先进的 MLLM,包括 GPT-4o、Gemini 1.5 Pro 以及主流开源模型。结果显示,当前模型在全景语境下的空间推理表现不佳,凸显了需要更具感知 grounding 能力的 MLLM。OSR-Bench 与代码将发布于:https://huggingface.co/datasets/UUUserna/OSR-Bench
引用
@article{arxiv.2505.11907,
title = {Are Multimodal Large Language Models Ready for Omnidirectional Spatial Reasoning?},
author = {Zihao Dongfang and Xu Zheng and Ziqiao Weng and Yuanhuiyi Lyu and Danda Pani Paudel and Luc Van Gool and Kailun Yang and Xuming Hu},
journal= {arXiv preprint arXiv:2505.11907},
year = {2025}
}