COS3D:协同式开放词汇3D分割
计算机视觉与模式识别
2025-10-24 v1
摘要
开放词汇3D分割是一项基础但具有挑战性的任务,需要对分割和语言有共同的理解。然而,现有的基于高斯泼溅的方法要么依赖于单一的3D语言场,导致分割效果较差,要么依赖于预计算的类别无关分割,导致误差累积。为了解决这些局限性,我们提出了COS3D,一种新的协同式提示-分割框架,有助于在其整个流程中有效整合互补的语言和分割线索。我们首先引入了协同场的新概念,包括一个实例场和一个语言场,作为协同的基石。在训练期间,为了有效构建协同场,我们的关键思想是通过新颖的实例到语言特征映射和设计高效的两阶段训练策略,来捕捉实例场和语言场之间的内在关系。在推理期间,为了弥合两个场的不同特征,我们进一步设计了自适应的语言到实例提示细化,促进了高质量的提示-分割推理。大量实验不仅证明了COS3D在两个广泛使用的基准测试上优于现有方法的领先性能,还展示了其在各种应用中的巨大潜力,例如,新颖的基于图像的3D分割、层次化分割和机器人技术。代码公开于\href{https://github.com/Runsong123/COS3D}{https://github.com/Runsong123/COS3D}。
引用
@article{arxiv.2510.20238,
title = {COS3D: Collaborative Open-Vocabulary 3D Segmentation},
author = {Runsong Zhu and Ka-Hei Hui and Zhengzhe Liu and Qianyi Wu and Weiliang Tang and Shi Qiu and Pheng-Ann Heng and Chi-Wing Fu},
journal= {arXiv preprint arXiv:2510.20238},
year = {2025}
}
备注
NeurIPS 2025. The code is publicly available at \href{https://github.com/Runsong123/COS3D}{https://github.com/Runsong123/COS3D}