中文

3D 人类的开放词汇语义部分分割

计算机视觉与模式识别 2025-02-28 v1

摘要

3D 部分分割是 3D 视觉和 AR/VR 领域的开放问题。由于 3D 标注数据有限,传统监督分割方法在泛化到未见形状和类别方面不足。近期视觉语言模型的零样体能力的提升带来了一波开放世界 3D 分割方法的涌现。虽然这些方法在 3D 场景或物体上显示出有前景的成果,但对 3D 人类适应性不足。本文提出首个能够处理 3D 人类的开放词汇分割方法。我们的框架可基于文本提示将人类类别分割为所需的细粒度部分。我们设计了简单的分割管道,利用 SAM 在二维中生成多视图提案,并提出一种新型 HumanCLIP 模型,用于创建视觉和文本输入的统一嵌入。与现有的预训练 CLIP 模型相比,HumanCLIP 模型为人类相关内容生成更精确的嵌入。我们还设计了一种简单而有效的 MaskFusion 模块,该模块在无需复杂投票和分组机制的情况下将多视图特征分类并融合为 3D 语义掩码。对解耦掩码提案和文本输入的设计显著提升了每个提示推理的效率。在各种 3D 人类数据集上的实验结果表明,我们的方法在当前最先进的开放词汇 3D 分割方法上以大幅优势获胜。此外,我们展示该方法可直接应用于各种 3D 表示,包括网格、点云和 3D 高斯渲染。

关键词

引用

@article{arxiv.2502.19782,
  title  = {Open-Vocabulary Semantic Part Segmentation of 3D Human},
  author = {Keito Suzuki and Bang Du and Girish Krishnan and Kunyao Chen and Runfa Blark Li and Truong Nguyen},
  journal= {arXiv preprint arXiv:2502.19782},
  year   = {2025}
}

备注

3DV 2025