点、视角与文本:点云是否提升大型语言模型的空间推理能力?——基于偏差控制的研究
计算机视觉与模式识别
2026-05-28 v2 人工智能
摘要
利用点云中空间信息进行 3D 空间推理的 3D 大型语言模型(LLM)引起了广泛关注。尽管已有一些鼎舞性结果,但点云相较于其他模态的优势仍不明确。此外,现有的 3D 基准测试不足以公正地评估多模态大型语言模型理解空间概念的能力。为此,我们引入了 ScanReQA,这是一个包含文本、视觉和点云三种模态的 3D 空间推理基准测试集合。随后,我们对文本、2D 和 3D LLMs 在该基准测试上的表现进行评估,以比较不同模态在理解空间概念方面的效果。进一步,我们分析了基于点云的 3D LLMs 的推理机制。我们的发现表明:1)当前 3D LLMs 在二进制空间推理方面仍具有挑战性;2)基于点云和视觉模态的多模态大型语言模型(MLLMs)在空间推理能力上优于 LLMs;3)3D LLMs exhibits attention sink 现象,类似于 2D LLMs 中的注意力沉淀现象,从而损害空间推理能力。我们认为,这些结论有助于下一步发展 3D LLMs,也为其他模态的基础模型提供了启示。我们将在项目页面发布数据集和代码:https://github.com/EmbodiedCity/ScanReQA.code。
引用
@article{arxiv.2504.04540,
title = {The Point, the Vision and the Text: Does Point Cloud Boost Spatial Reasoning of Large Language Models? A Bias-Controlled Study},
author = {Weichen Zhang and Ruiying Peng and Xin Zeng and Jianjie Fang and Ziyou Wang and Kaiyuan Li and Heng Dong and Wei Li and Chen Gao and Xin Wang and Xinlei Chen and Yong Li},
journal= {arXiv preprint arXiv:2504.04540},
year = {2026}
}