中文

从自然语言描述实现场景中任意 3D 部件分割

计算机视觉与模式识别 2025-06-25 v1

摘要

本文旨在实现基于自然语言描述对场景中任意 3D 部件的分割,这超越了传统的对象级 3D 场景理解范畴,同时解决数据和方法论层面的挑战。由于获取和标注成本高昂,现有数据集和方法主要局限于对象级理解。为克服数据和标注可获得性的限制,我们引入了 3D-PU 数据集,首个大规模带有稠密部件标注的 3D 数据集,通过一种创新且高效的合成 3D 场景构建方法实现细粒度部件级标注,为先进的 3D 部件场景理解铺平了道路。在方法论层面,我们提出了 OpenPart3D,一种仅依赖 3D 输入的框架,有效应对部件级分割的挑战。大量实验表明,我们的方法在开放词汇 3D 场景理解任务中具有优势,能够在各种 3D 场景数据集上实现强大的泛化能力。

关键词

引用

@article{arxiv.2506.19331,
  title  = {Segment Any 3D-Part in a Scene from a Sentence},
  author = {Hongyu Wu and Pengwan Yang and Yuki M. Asano and Cees G. M. Snoek},
  journal= {arXiv preprint arXiv:2506.19331},
  year   = {2025}
}