用于三维语义场景补全的各向异性卷积网络
计算机视觉与模式识别
2020-04-07 v1
摘要
作为一项体素级标注任务,语义场景补全(SSC)试图从单张深度和/或 RGB 图像同时推断场景的占据情况与语义标签。SSC 的关键挑战在于如何有效利用三维上下文来建模形状、布局与可见性上差异严重的各类物体或背景。为应对此类变化,我们提出一种称为各向异性卷积(anisotropic convolution)的新模块,其具备灵活性与表达能力,是以标准三维卷积及其某些变体为代表的竞争方法所不及的。与局限于固定三维感受野的标准三维卷积不同,我们的模块能够逐体素地建模维度各向异性。基本思路是通过将三维卷积分解为三个连续的 1D 卷积来实现各向异性三维感受野,且每个此类 1D 卷积的核大小按需自适应确定。通过堆叠多个这样的各向异性卷积模块,可在保持可控模型参数量的同时进一步增强逐体素建模能力。在两个 SSC 基准 NYU-Depth-v2 与 NYUCAD 上的大量实验显示了所提方法的优越性能。我们的代码见 https://waterljwant.github.io/SSC/
引用
@article{arxiv.2004.02122,
title = {Anisotropic Convolutional Networks for 3D Semantic Scene Completion},
author = {Jie Li and Kai Han and Peng Wang and Yu Liu and Xia Yuan},
journal= {arXiv preprint arXiv:2004.02122},
year = {2020}
}