当LLM步入3D世界:基于多模态大语言模型的3D任务全景调查与元分析
计算机视觉与模式识别
2025-10-22 v2 机器人学
摘要
随着大型语言模型(LLM)的演进,它们与3D空间数据(3D-LLM)的集成取得了快速进展,为理解和与物理空间交互提供了前所未有的能力。本次调查提供了概述LLM处理、理解和生成3D数据的方法。突出显示LLM的独特优势,如按需学习、逐步推理、开放词汇能力和广泛的世界知识,凸显了它们在 embodied 人工智能(AI)系统中实现空间理解和交互方面的潜力。我们的调查涵盖了各种3D数据表示,从点云到神经辐射场(NeRF)。它检查了它们如何与LLM集成,用于3D场景理解、描述、问答和对话,以及LLM-based智能体用于空间推理、规划和导航。本文还包括对其他集成3D和语言方法的简要回顾。本文所呈现的元分析揭示了显着的进展,同时强调了必要性以充分发挥3D-LLM潜能的新方法。因此,随着本文,我们旨在为未来研究绘制道路,探索和扩展3D-LLM在理解和与复杂3D世界交互方面的能力。为支持本次调查,我们已建立了一个项目页面,其中对与我们的主题相关的论文进行组织和列出:https://github.com/ActiveVisionLab/Awesome-LLM-3D
引用
@article{arxiv.2405.10255,
title = {When LLMs step into the 3D World: A Survey and Meta-Analysis of 3D Tasks via Multi-modal Large Language Models},
author = {Xianzheng Ma and Brandon Smart and Yash Bhalgat and Shuai Chen and Xinghui Li and Jian Ding and Jindong Gu and Dave Zhenyu Chen and Songyou Peng and Jia-Wang Bian and Philip H Torr and Marc Pollefeys and Matthias Nießner and Ian D Reid and Angel X. Chang and Iro Laina and Victor Adrian Prisacariu},
journal= {arXiv preprint arXiv:2405.10255},
year = {2025}
}
备注
2nd version update to Jun.2025