中文

面向 3D 语义分割的相似性感知融合网络

计算机视觉与模式识别 2021-07-20 v3 机器人学

摘要

本文提出一种相似性感知融合网络(SAFNet),用于自适应融合 2D 图像与 3D 点云以实现 3D 语义分割。现有基于融合的方法通过整合多模态信息取得了显著性能。然而,它们严重依赖通过投影建立的 2D 像素与 3D 点之间的对应关系,且只能以固定方式进行信息融合,因此其性能难以迁移至所采集数据常缺乏严格成对预测特征的更真实场景。为此,我们采用后期融合策略:首先学习输入点云与(由 2D 像素)反投影点云之间的几何与上下文相似性,并利用它们引导两模态的融合以进一步挖掘互补信息。具体而言,我们采用几何相似性模块(GSM)直接比较成对 3D 邻域的空间坐标分布,以及上下文相似性模块(CSM)聚合并比较对应中心点的空间上下文信息。这两个提出的模块能有效度量图像特征对预测的帮助程度,使网络自适应调整两模态对每点最终预测的贡献。在 ScanNetV2 基准上的实验结果表明,SAFNet 在各种数据完整性下均显著优于现有最先进的基于融合的方法。

关键词

引用

@article{arxiv.2107.01579,
  title  = {Similarity-Aware Fusion Network for 3D Semantic Segmentation},
  author = {Linqing Zhao and Jiwen Lu and Jie Zhou},
  journal= {arXiv preprint arXiv:2107.01579},
  year   = {2021}
}

备注

Accepted by 2021 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2021)