PartSAM:基于原生3D数据的可扩展可提示3D部分分割模型
计算机视觉与模式识别
2026-02-27 v3
摘要
将3D对象分割成部分是计算机视觉中长期存在的挑战。为克服分类约束并实现对未见3D对象的泛化,近期研究转向开放世界部分分割。这些方法通常通过将多视图掩码提升到3D来从2D基础模型(如SAM)迁移监督信息。然而,这种间接范式未能捕捉内在几何,导致仅能进行表面理解、分割控制且泛化受限。我们提出PartSAM,是首个在大规模3D数据上进行原生训练的可提示部分分割模型。遵循SAM的设计理念,PartSAM采用编码器-解码器架构,三平面基的双分支编码器产生空间结构化标记,以实现可扩展的部分感知表示学习。为实现大规模监督,我们进一步引入一种模型内循环标注管道,从在线资源中 curated 超过五百万3D形状-部分对,提供多样且细粒度的标签。这种可扩展架构与多样3D数据的结合产生了显现的开放世界能力:仅通过一个提示,PartSAM即可实现高度准确的部分识别;在Segment-Every-Part模式下,能够自动将形状分解为表面和内部结构。广泛的实验表明,PartSAM在多个基准测试中均显著优于现有方法,标志着向3D部分理解基础模型迈出决定性步伐。
引用
@article{arxiv.2509.21965,
title = {PartSAM: A Scalable Promptable Part Segmentation Model Trained on Native 3D Data},
author = {Zhe Zhu and Le Wan and Rui Xu and Yiheng Zhang and Honghua Chen and Zhiyang Dou and Cheng Lin and Yuan Liu and Mingqiang Wei},
journal= {arXiv preprint arXiv:2509.21965},
year = {2026}
}
备注
ICLR 2026. Project Page: https://czvvd.github.io/PartSAMPage/