重新思考基于高斯光束的 2D 到 3D 场景分割
计算机视觉与模式识别
2025-03-19 v1
摘要
将多视角 2D 实例分割提升至辐射场已被证明是增强 3D 理解有效的方法。现有方法依赖直接匹配进行端到端提升,效果不佳;或采用受复杂预处理或后处理约束的两阶段解决方案。在本工作中,我们设计了一种新的端到端对象感知提升方法,命名为 Unified-Lift,基于 3D 高斯表示提供精确的 3D 分段。首先,我们为每个高斯点增添一个额外的高斯级特征,通过对比损失学习以编码实例信息。重要的是,我们引入一个可学习的对象级词汇表,以 account individual objects in the scene for explicit object-level understanding,并将编码的对象级特征与高斯级点特征关联,用于分割预测。尽管如此,实现有效的词汇表学习并非易事,朴素的解决方案会导致性能下降。因此,我们构建了关联学习模块和噪声标签过滤模块,以实现有效且稳健的词汇表学习。我们在三个基准数据集上进行实验:LERF-Masked、Replica 和 Messy Rooms。定性和定量结果均表明,Unified-Lift 在分割质量和时间效率方面明显优于现有方法。代码已公开于 \href{https://github.com/Runsong123/Unified-Lift}{https://github.com/Runsong123/Unified-Lift}。
引用
@article{arxiv.2503.14029,
title = {Rethinking End-to-End 2D to 3D Scene Segmentation in Gaussian Splatting},
author = {Runsong Zhu and Shi Qiu and Zhengzhe Liu and Ka-Hei Hui and Qianyi Wu and Pheng-Ann Heng and Chi-Wing Fu},
journal= {arXiv preprint arXiv:2503.14029},
year = {2025}
}
备注
CVPR 2025. The code is publicly available at this https URL (https://github.com/Runsong123/Unified-Lift)