中文

如何赋予LLM 3D能力?空间推理LLM综述

计算机视觉与模式识别 2026-03-23 v1 人工智能

摘要

3D空间理解在机器人、自动驾驶、虚拟现实和医学成像等实际应用中至关重要。最近,大型语言模型(LLM)在各类领域展现了显著成功,被用于增强3D理解任务,显示出超越传统计算机视觉方法的潜力。本综述系统性地综述了将LLM与3D空间理解集成的方法。我们提出了一种分类法,将现有方法分为三个分支:基于图像的方法通过2D视觉数据推导3D理解;基于点云的方法直接处理3D表示;基于混合模态的方法整合多种数据流。我们系统性地综述了这些类别中的代表性方法,涵盖数据表示、架构修改和桥接文本与3D模态的训练策略。最后,我们讨论了当前局限,包括数据集稀缺和计算挑战,同时概述了在空间感知、多模态融合和实际应用方面的有前景的研究方向。

关键词

引用

@article{arxiv.2504.05786,
  title  = {How to Enable LLM with 3D Capacity? A Survey of Spatial Reasoning in LLM},
  author = {Jirong Zha and Yuxuan Fan and Xiao Yang and Chen Gao and Xinlei Chen},
  journal= {arXiv preprint arXiv:2504.05786},
  year   = {2026}
}

备注

9 pages, 5 figures