室内开放词汇 3D 实例分割中细节决定成败
计算机视觉与模式识别
2025-08-01 v1
摘要
与常在闭合词汇 3D 实例分割中通过端到端训练不同,开放词汇 3D 实例分割 (OV-3DIS) 通常利用视觉语言模型 (Vision-Language Models, VLMs) 生成 3D 实例提案并对其进行分类。尽管已提出多种概念,但我们注意到这些单个概念并非互斥而是互补。本文提出了一种新的 SOTA 解决方案,通过仔细设计将这些概念组合在一起的配方,并针对关键挑战进行细化。我们的解决方案遵循两阶段方案:3D 提案生成和实例分类。我们采用稳健的 3D 跟踪基于提案聚合来生成 3D 提案,并通过迭代合并/移除来去除重叠或局部提案。对于分类阶段,我们用 Alpha-CLIP 替代标准 CLIP 模型,Alpha-CLIP 将对象掩码作为 alpha 通道引入,以减少背景噪声并获得对象中心表示。此外,我们引入标准化最大相似度 (Standardized Maximum Similarity, SMS) 评分来规范化文本到提案的相似度,有效过滤假阳性并提升精度。我们的框架在 ScanNet200 和 S3DIS 上在所有 AP 和 AR 指标上均实现了 SOTA 性能,甚至超越了端到端的闭合词汇方法。
引用
@article{arxiv.2507.23134,
title = {Details Matter for Indoor Open-vocabulary 3D Instance Segmentation},
author = {Sanghun Jung and Jingjing Zheng and Ke Zhang and Nan Qiao and Albert Y. C. Chen and Lu Xia and Chi Liu and Yuyin Sun and Xiao Zeng and Hsiang-Wei Huang and Byron Boots and Min Sun and Cheng-Hao Kuo},
journal= {arXiv preprint arXiv:2507.23134},
year = {2025}
}
备注
ICCV 2025