中文

All in One:视觉描述引导的统一点云分割

计算机视觉与模式识别 2025-07-28 v2 人工智能

摘要

3D 点云的统一分割对于场景理解至关重要,但其稀疏的结构、有限的标注以及在复杂环境中区分细粒度物体类别的挑战阻碍了这一技术的发展。由于监督有限且缺乏多样化的多模态线索,现有方法通常难以捕捉丰富的语义和上下文信息,导致类别和实例的区分效果欠佳。为了应对这些挑战,我们提出了 VDG-Uni3DSeg,这是一个集成预训练视觉-语言模型(如 CLIP)和大语言模型(LLM)以增强 3D 分割的新框架。通过利用 LLM 生成的文本描述和来自互联网的参考图像,我们的方法引入了丰富的多模态线索,促进了细粒度的类别和实例分离。我们进一步设计了语义-视觉对比损失来对齐点特征与多模态查询,并设计了一个空间增强模块以高效地建模场景级关系。VDG-Uni3DSeg 在利用离线生成的多模态知识的闭集范式内运行,在语义分割、实例分割和全景分割中取得了 state-of-the-art 的结果,为 3D 理解提供了可扩展且实用的解决方案。我们的代码可在 https://github.com/Hanzy1996/VDG-Uni3DSeg 获取。

关键词

引用

@article{arxiv.2507.05211,
  title  = {All in One: Visual-Description-Guided Unified Point Cloud Segmentation},
  author = {Zongyan Han and Mohamed El Amine Boudjoghra and Jiahua Dong and Jinhong Wang and Rao Muhammad Anwer},
  journal= {arXiv preprint arXiv:2507.05211},
  year   = {2025}
}

备注

Accepted by ICCV2025