SAI3D:在3D场景中分割任意实例
计算机视觉与模式识别
2024-03-26 v2
摘要
3D实例分割的进展传统上受限于标注数据集的可用性,将其应用限制在狭窄的物体类别范围内。近期的努力试图利用如CLIP等视觉-语言模型进行开放集语义推理,然而这些方法难以区分同一类别的物体,且依赖于并非普遍适用的特定提示。在本文中,我们介绍了SAI3D,一种新颖的零样本3D实例分割方法,协同利用几何先验和从Segment Anything Model (SAM)导出的语义线索。我们的方法将3D场景划分为几何基元,随后逐步将其合并为与多视图SAM掩码一致的3D实例分割。此外,我们设计了一种带有动态阈值机制的分层区域生长算法,大大提高了细粒度3D场景解析的鲁棒性。在ScanNet、Matterport3D以及更具挑战性的ScanNet++数据集上的实证评估证明了我们方法的优越性。值得注意的是,SAI3D超越了现有的开放词汇基线,甚至在ScanNet++上的无类别分割中超越了全监督方法。我们的项目页面位于 https://yd-yin.github.io/SAI3D。
引用
@article{arxiv.2312.11557,
title = {SAI3D: Segment Any Instance in 3D Scenes},
author = {Yingda Yin and Yuzheng Liu and Yang Xiao and Daniel Cohen-Or and Jingwei Huang and Baoquan Chen},
journal= {arXiv preprint arXiv:2312.11557},
year = {2024}
}
备注
CVPR 2024