中文

GPT4Point:一个统一的点云-语言理解与生成框架

计算机视觉与模式识别 2025-06-02 v2

摘要

多模态大语言模型(MLLMs)在2D图像-文本理解和图像生成方面表现出色,但它们对3D世界的理解明显不足,限制了3D语言理解和生成的进展。为了解决这个问题,我们引入了GPT4Point,这是一个创新的、开创性的点云-语言多模态模型,专为MLLM框架内的统一3D对象理解和生成而设计。GPT4Point作为一个强大的3D MLLM,可以无缝执行各种点云-文本参考任务,如点云描述和问答。此外,GPT4Point具备先进的3D可控生成能力,它可以通过低质量的点云-文本特征获得高质量的结果,同时保持几何形状和颜色。为了支持对3D对象-文本对的广泛需求,我们开发了Pyramid-XL,一个点云-语言数据集标注引擎。它从Objaverse-XL数据集中构建了一个包含超过100万个对象、具有不同文本粒度级别的大规模数据库,这对于训练GPT4Point至关重要。我们提出了一个全面的基准来评估3D点云-语言理解能力。在广泛的评估中,GPT4Point在理解和生成方面都展示了卓越的性能。

关键词

引用

@article{arxiv.2312.02980,
  title  = {GPT4Point: A Unified Framework for Point-Language Understanding and Generation},
  author = {Zhangyang Qi and Ye Fang and Zeyi Sun and Xiaoyang Wu and Tong Wu and Jiaqi Wang and Dahua Lin and Hengshuang Zhao},
  journal= {arXiv preprint arXiv:2312.02980},
  year   = {2025}
}