UniPLV:基于区域视觉语言监督的标签高效开放世界3D场景理解
计算机视觉与模式识别
2025-09-18 v2
摘要
开放世界3D场景理解是一项关键挑战,涉及从3D数据(如点云)中识别和区分多样化的对象和类别,而不依赖手动标注。传统方法在这一开放世界任务中表现不佳,尤其受限于构建大量点云-文本配对和有效处理多模态数据的限制。为此,我们提出UniPLV,一个统一点云、图像和文本于单一学习范式的强大框架,用于全面的3D场景理解。UniPLV利用图像作为桥梁,将3D点与预对齐的图像和文本共嵌入共享特征空间,无需构建繁琐的点云-文本配对。我们的框架通过两种创新策略实现精准的多模态对齐:(i)在图像和点云之间的Logit和特征蒸馏模块以增强特征一致性;(ii)一种视觉-点匹配模块,隐式纠正因点到像素投影不准确而影响的3D语义预测。为进一步提升性能,我们在四个任务特定损失的基础上实施了两阶段训练策略。广泛的实验表明,UniPLV显著优于现有SOTA方法,在Base-Annotated和Annotation-Free任务的语义分割上分别实现了约15.6%和14.8%的平均提升。这些结果凸显了UniPLV在推动开放世界3D场景理解边界方面的有效性。我们将发布代码以支持未来的研究与开发。
引用
@article{arxiv.2412.18131,
title = {UniPLV: Towards Label-Efficient Open-World 3D Scene Understanding by Regional Visual Language Supervision},
author = {Yuru Wang and Pei Liu and Songtao Wang and Zehan Zhang and Xinyan Lu and Changwei Cai and Hao Li and Fu Liu and Peng Jia and Xianpeng Lang},
journal= {arXiv preprint arXiv:2412.18131},
year = {2025}
}