中文

迈向更深且更优的多视图特征融合用于 3D 语义分割

计算机视觉与模式识别 2022-12-14 v1

摘要

3D 点云富含几何结构信息,而 2D 图像包含重要且连续的纹理信息。结合 2D 信息以实现更好的 3D 语义分割已成为 3D 场景理解的主流。尽管取得成功,如何融合与处理来自这两个不同空间的跨维度特征仍不明晰。现有最优方法通常利用双向投影方法对齐跨维度特征并同时实现 2D 与 3D 语义分割任务。然而,为实现双向映射,该框架常需对称的 2D-3D 网络结构,从而限制了网络灵活性。同时,此类双任务设定易分散网络注意力并导致 3D 分割任务中的过拟合。受限于网络不灵活性,融合特征仅能穿过一个解码器网络,因深度不足而影响模型性能。为缓解这些缺陷,本文主张:尽管简单,将多视图 2D 深度语义特征单向投影到与 3D 深度语义特征对齐的 3D 空间中,可带来更好的特征融合。一方面,单向投影使我们的模型更聚焦于核心任务即 3D 分割;另一方面,将双向解锁为单向投影实现了更深跨域语义对齐,并享有灵活性以融合来自极不同空间的更优且复杂特征。在联合 2D-3D 方法中,我们提出的方法在 ScanNetv2 基准上取得了优于他人的 3D 语义分割性能。

关键词

引用

@article{arxiv.2212.06682,
  title  = {Towards Deeper and Better Multi-view Feature Fusion for 3D Semantic Segmentation},
  author = {Chaolong Yang and Yuyao Yan and Weiguang Zhao and Jianan Ye and Xi Yang and Amir Hussain and Kaizhu Huang},
  journal= {arXiv preprint arXiv:2212.06682},
  year   = {2022}
}