中文

基于传统/学习型 3D 描述符的数据高效 3D 场景解析综述与鲁棒框架

计算机视觉与模式识别 2023-12-05 v1 机器人学

摘要

现有的最先进 3D 点云理解方法仅在全监督方式下表现良好。据我们所知,目前尚不存在一个统一的框架能够同时解决包括分割和检测在内的下游高层理解任务,尤其是在标签极其有限的情况下。本工作提出了一个通用且简单的框架,以在标签有限的情况下解决点云理解问题。第一个贡献是,我们对弱监督 3D 场景理解任务中的传统和学习型 3D 描述符进行了广泛的方法比较,并验证了我们改编的传统基于 PFH 的 3D 描述符在不同领域间展现出出色的泛化能力。第二个贡献是,我们提出了一种基于区域合并策略的学习方法,该策略基于传统/学习型 3D 描述符和学习型语义提供的亲和度。合并过程同时考虑了低级几何和高级语义特征相关性。实验结果表明,我们的框架在三个最重要的弱监督点云理解任务(包括语义分割、实例分割和目标检测)中均具有最佳性能,即使在被标注的点非常少的情况下也是如此。我们的方法称为区域合并 3D(RM3D),在 ScanNet 数据高效学习在线排行榜和其他四个大规模 3D 理解排行榜上的各种实验设置下均表现出优越的性能,在没有使用主动学习等复杂学习策略的情况下,在各种 3D 理解任务上均以显著优势超越了当前最优方法。

关键词

引用

@article{arxiv.2312.01262,
  title  = {A Review and A Robust Framework of Data-Efficient 3D Scene Parsing with Traditional/Learned 3D Descriptors},
  author = {Kangcheng Liu},
  journal= {arXiv preprint arXiv:2312.01262},
  year   = {2023}
}

备注

International Journal of Computer Vision (IJCV), 2022. 10 Figures, 13 Tables