通过二维视觉特征的几何聚合实现三维部件分割
计算机视觉与模式识别
2025-01-09 v2
摘要
监督式三维部件分割模型针对固定的物体和部件集合进行定制,限制了其在开放集、真实世界场景中的可迁移性。近期研究探索了视觉-语言模型(VLM)作为一种有前景的替代方案,利用多视角渲染和文本提示来识别物体部件。然而,在此背景下直接应用VLM会带来若干缺点,例如需要精细的提示工程,并且未能利用物体的三维几何结构。为解决这些局限性,我们提出了COPS,一个综合性的部件分割模型,它融合了从视觉概念和三维几何中提取的语义,以有效识别物体部件。COPS从多个视角渲染点云,提取二维特征,将其投影回三维,并使用一种新颖的几何感知特征聚合流程来确保空间和语义一致性。最后,它将点聚类为部件并为其标注。我们证明了COPS高效、可扩展,并在五个数据集上实现了零样本的最先进性能,涵盖合成和真实世界数据、无纹理和彩色物体,以及刚性和非刚性形状。代码可在 https://3d-cops.github.io 获取。
引用
@article{arxiv.2412.04247,
title = {3D Part Segmentation via Geometric Aggregation of 2D Visual Features},
author = {Marco Garosi and Riccardo Tedoldi and Davide Boscaini and Massimiliano Mancini and Nicu Sebe and Fabio Poiesi},
journal= {arXiv preprint arXiv:2412.04247},
year = {2025}
}
备注
Published in WACV 2025. Project page: https://3d-cops.github.io/