中文

3D 点云的基础模型:综述与展望

计算机视觉与模式识别 2025-01-31 v1

摘要

3D 点云表示在保留物理世界几何保真度方面发挥着关键作用,使更准确的复杂 3D 环境成为可能。尽管人类通过多感官系统自然地理解对象之间的复杂关系和变化,但人工智能(AI)系统尚未完全复制这一能力。为弥合这一差距,必须融合多种模态。能够无缝整合并跨模态推理的模型称为基础模型(FMs)。2D 模态(如图像和文本)的基础模型开发取得了显著进展,这得益于大规模数据集的丰富性。然而,3D 领域因标注数据稀缺和计算开销高而滞后。为此,近期研究开始探索将 FMs 应用于 3D 任务,通过利用现有的 2D 知识来克服这些挑战。此外,语言由于其抽象推理和环境描述能力,为通过大规模预训练语言模型(LLMs)增强 3D 理解提供了可行之路。尽管近年来 FMs 在 3D 视觉任务方面的快速发展和采纳,但在综合和深入的文献综述方面仍存在差距。本文旨在弥补这一差距,通过呈现利用 FMs 进行 3D 视觉理解的最新方法的全面概述。我们首先回顾了构建各种 3D FMs 的各种策略。随后对不同 FMs 用于感知任务进行分类和总结。最后,本文提供了关于该领域未来研究和开发方向的见解。为帮助读者,我们精选了一系列相关论文:https://github.com/vgthengane/Awesome-FMs-in-3D。

关键词

引用

@article{arxiv.2501.18594,
  title  = {Foundational Models for 3D Point Clouds: A Survey and Outlook},
  author = {Vishal Thengane and Xiatian Zhu and Salim Bouzerdoum and Son Lam Phung and Yunpeng Li},
  journal= {arXiv preprint arXiv:2501.18594},
  year   = {2025}
}

备注

Initial submission