中文

减少点数:面向3D 数据高效点-语言理解的新方法

计算机视觉与模式识别 2025-05-23 v3 人工智能 计算与语言

摘要

使大型语言模型(LLM)能够理解3D 物理世界仍是一个重大挑战。由于缺乏大规模的3D-文本配对数据集,LLM 的成功尚未在3D 理解中得到复制。在本文中,我们重新思考了这一问题,提出了一种新任务:3D 数据高效点-语言理解。目标是使 LLM 能够仅使用最少的3D 点云和文本数据对,即可实现稳健的3D 对象理解。为解决这一任务,我们引入 GreenPLM,通过更多文本数据来弥补3D数据的不足。首先,受利用 CLIP 对齐图像和文本的启发,我们使用预训练的点云-文本编码器将3D 点云空间映射到文本空间。这为我们将文本空间无缝连接到 LLM 留下了余地。一旦建立了点-文本-LLM 连接,我们进一步通过扩充中间文本空间来增强文本-LLM 对齐,从而减少对3D 点云数据的依赖。具体而言,我们生成600万个3D 对象的自由文本描述,并设计三阶段训练策略以帮助 LLM 更好地探索不同模态之间的内在联系。为实现高效的模态对齐,我们设计了一个零参数的跨注意力模块用于 token 汇聚。大量实验结果表明,GreenPLM 只需使用现有最先进模型所需的12%的3D训练数据即可实现优异的3D理解。令人惊讶的是,GreenPLM 甚至可以使用仅限文本的数据实现竞争性能。代码和模型权重已提供: https://github.com/TangYuan96/GreenPLM。

关键词

引用

@article{arxiv.2408.15966,
  title  = {More Text, Less Point: Towards 3D Data-Efficient Point-Language Understanding},
  author = {Yuan Tang and Xu Han and Xianzhi Li and Qiao Yu and Jinfeng Xu and Yixue Hao and Long Hu and Min Chen},
  journal= {arXiv preprint arXiv:2408.15966},
  year   = {2025}
}