中文

用于全分辨率三维语义场景补全的级联上下文金字塔

计算机视觉与模式识别 2019-08-02 v1

摘要

语义场景补全(SSC)旨在同时预测三维场景的体积占用和语义类别。它帮助智能设备理解并与其周围场景进行交互。由于高内存需求,当前方法仅能生成低分辨率的补全预测,并且通常会丢失物体细节。此外,它们还忽略了对三维推理至关重要的多尺度空间上下文。为了解决这些问题,本文提出了一种新颖的深度学习框架,名为级联上下文金字塔网络(CCPNet),用于从单张深度图像联合推断体积三维场景的占用和语义标签。所提出的CCPNet通过级联上下文金字塔改善了标签一致性。同时,基于低级特征,它利用引导残差细化(GRR)模块逐步恢复物体的精细结构。我们提出的框架具有三个突出优点:(1)显式地对三维空间上下文进行建模以提升性能;(2)生成保留结构细节的全分辨率三维体积;(3)捕获了内存需求低的轻量级模型,具有良好的可扩展性。大量实验表明,尽管仅使用单视图深度图,我们提出的框架仍能生成高质量的SSC结果,并在合成SUNCG和真实NYU数据集上均优于最先进的方法。

关键词

引用

@article{arxiv.1908.00382,
  title  = {Cascaded Context Pyramid for Full-Resolution 3D Semantic Scene Completion},
  author = {Pingping Zhang and Wei Liu and Yinjie Lei and Huchuan Lu and Xiaoyun Yang},
  journal= {arXiv preprint arXiv:1908.00382},
  year   = {2019}
}

备注

This work has been accepted as an Oral presentation at ICCV2019, including 10 pages, 6 figures and 6 tables