通过可学习的层次化部件融合实现鲁棒的三维场景分割
计算机视觉与模式识别
2021-11-17 v1
摘要
三维语义分割是自动驾驶、机器人和 AR/VR 等多种场景理解应用的基础构建模块。若干最先进的语义分割模型存在部件误分类问题,即同一对象的不同部件被错误标注。以往方法利用层次化、迭代的方法融合语义与实例信息,但缺乏上下文融合的可学习性,且计算复杂、依赖启发式。本文提出 Segment-Fusion,一种新颖的基于注意力的方法,用于层次化融合语义与实例信息以解决部件误分类问题。该方法包含一个将的点分组为片段的图分割算法(将逐点特征池化为片段级特征)、一个基于可学习注意力的网络(根据其语义与实例特征融合这些片段),以及随后一个简单而有效的连通分量标记算法(将片段特征转换为实例标签)。Segment-Fusion 可灵活地与任意语义/实例分割网络架构结合使用。在 ScanNet 和 S3DIS 数据集上评估时,它将多种语义分割主干的定性与定量性能提升了至多 5%。
引用
@article{arxiv.2111.08434,
title = {Robust 3D Scene Segmentation through Hierarchical and Learnable Part-Fusion},
author = {Anirud Thyagharajan and Benjamin Ummenhofer and Prashant Laddha and Om J Omer and Sreenivas Subramoney},
journal= {arXiv preprint arXiv:2111.08434},
year = {2021}
}