PiSA:一种用于 3D 理解的自增强数据引擎与训练策略
计算机视觉与模式识别
2025-03-14 v1 人工智能
摘要
3D 多模态大语言模型(MLLM)最近取得了显著进展。然而,其潜力尚未被充分发挥,主要源于 3D 数据集的数量有限且质量不佳。当前方法尝试从 2D MLLM 转移知识以扩充 3D 指令数据,但仍面临模态和领域差距。为此,我们引入 PiSA-Engine(Point-Self-Augmented-Engine),一个用于生成富含 3D 空间语义的指令点-语言数据集的新框架。我们观察到,现有的 3D MLLM 在注释方面提供了对点云的全面理解,而 2D MLLM 通过提供补充信息在交叉验证方面表现出色。通过整合来自现成 MLLM 的全面 2D 和 3D 见解,PiSA-Engine 实现了高质量数据生成的循环。我们选用 PointLLM 作为基线,并采用这种共演化训练框架开发出增强版 3D MLLM,称为 PointLLM-PiSA。此外,我们识别出以往 3D 基准的局限性——它们常常包含粗糙的语言描述和不足的类别多样性,导致评估不准确。为此,我们进一步引入 PiSA-Bench,一个覆盖六个关键方面、带有详细且多样化标签的综合性 3D 基准。实验结果表明,PointLLM-PiSA 在我们 PiSA-Bench 上的零样 3D 目标描述和生成式分类分别实现了 46.45%(+8.33%)和 63.75%(+16.25%)的显著提升。我们将发布代码、数据集和基准。
引用
@article{arxiv.2503.10529,
title = {PiSA: A Self-Augmented Data Engine and Training Strategy for 3D Understanding with Large Models},
author = {Zilu Guo and Hongbin Lin and Zhihao Yuan and Chaoda Zheng and Pengshuo Qiu and Dongzhi Jiang and Renrui Zhang and Chun-Mei Feng and Zhen Li},
journal= {arXiv preprint arXiv:2503.10529},
year = {2025}
}
备注
Technical Report