如何赋予LLM 3D能力?空间推理LLM综述
计算机视觉与模式识别
2026-03-23 v1 人工智能
摘要
3D空间理解在机器人、自动驾驶、虚拟现实和医学成像等实际应用中至关重要。最近,大型语言模型(LLM)在各类领域展现了显著成功,被用于增强3D理解任务,显示出超越传统计算机视觉方法的潜力。本综述系统性地综述了将LLM与3D空间理解集成的方法。我们提出了一种分类法,将现有方法分为三个分支:基于图像的方法通过2D视觉数据推导3D理解;基于点云的方法直接处理3D表示;基于混合模态的方法整合多种数据流。我们系统性地综述了这些类别中的代表性方法,涵盖数据表示、架构修改和桥接文本与3D模态的训练策略。最后,我们讨论了当前局限,包括数据集稀缺和计算挑战,同时概述了在空间感知、多模态融合和实际应用方面的有前景的研究方向。
引用
@article{arxiv.2504.05786,
title = {How to Enable LLM with 3D Capacity? A Survey of Spatial Reasoning in LLM},
author = {Jirong Zha and Yuxuan Fan and Xiao Yang and Chen Gao and Xinlei Chen},
journal= {arXiv preprint arXiv:2504.05786},
year = {2026}
}
备注
9 pages, 5 figures