MM-Spatial:探索多模态 LLM 中的 3D 空间理解
计算机视觉与模式识别
2025-09-09 v2 计算与语言
机器学习
摘要
多模态大语言模型(MLLMs)擅长 2D 视觉理解,但在 3D 空间推理能力方面仍然有限。在这项工作中,我们利用具有开放集标注的大规模高质量 3D 场景数据,引入了 1) 一个新的监督微调数据集和 2) 一个专注于室内场景的新评估基准。我们的 Cubify Anything VQA (CA-VQA) 数据涵盖了多种空间任务,包括空间关系预测、度量尺寸与距离估计以及 3D 定位。我们表明,CA-VQA 使我们能够训练出 MM-Spatial,一个强大的通用 MLLM,它在包括我们自己的基准在内的 3D 空间理解基准上也取得了 SOTA 的性能。我们展示了如何结合度量深度和多视图输入(在 CA-VQA 中提供)以进一步改善 3D 理解,并证明仅靠数据就能使我们的模型获得与专用单目深度估计模型相当的深度感知能力。
引用
@article{arxiv.2503.13111,
title = {MM-Spatial: Exploring 3D Spatial Understanding in Multimodal LLMs},
author = {Erik Daxberger and Nina Wenzel and David Griffiths and Haiming Gang and Justin Lazarow and Gefen Kohavi and Kai Kang and Marcin Eichner and Yinfei Yang and Afshin Dehghan and Peter Grasch},
journal= {arXiv preprint arXiv:2503.13111},
year = {2025}
}
备注
ICCV 2025