中文

面向室内场景联合三维重建与语义分割的实时在线学习框架

计算机视觉与模式识别 2021-12-30 v2

摘要

本文提出一种实时在线视觉框架,用于联合恢复室内场景的三维结构与语义标签。给定含噪声的深度图、相机轨迹以及训练时的 2D 语义标签,所提出的基于深度神经网络的方法学习在场景空间中将跨帧深度与合适的语义标签相融合。我们的方法利用场景特征空间中深度与语义的联合体素表示来解决该任务。为实现语义标签与几何的实时令人信服的在线融合,我们引入了高效的涡旋池化块,同时舍弃在线深度融合中路由网络的使用以保留高频表面细节。我们表明,场景语义所提供的上下文信息有助于深度融合网络学习抗噪特征。不仅如此,其还有助于克服当前在线深度融合方法在处理薄物体结构、增厚伪影及虚假表面方面的不足。在 Replica 数据集上的实验评估表明,根据深度图分辨率的不同,我们的方法能够以每秒 37 和 10 帧的速度执行深度融合,平均重建 F-score 分别为 88% 和 91%。此外,我们的模型在 ScanNet 3D 语义基准排行榜上展现出 0.515 的平均 IoU 分数。

关键词

引用

@article{arxiv.2108.05246,
  title  = {A Real-Time Online Learning Framework for Joint 3D Reconstruction and Semantic Segmentation of Indoor Scenes},
  author = {Davide Menini and Suryansh Kumar and Martin R. Oswald and Erik Sandstrom and Cristian Sminchisescu and Luc Van Gool},
  journal= {arXiv preprint arXiv:2108.05246},
  year   = {2021}
}

备注

Accepted for publication at IEEE Robotics and Automation Letters (RA-L), 2022. Draft info: 9 pages, 5 figures, 4 tables