ShapeConv:面向室内RGB-D语义分割的形状感知卷积层
计算机视觉与模式识别
2021-08-25 v1
摘要
RGB-D语义分割在过去几年中引起了越来越多的关注。现有方法大多采用同质的卷积算子来处理RGB和深度特征,忽略了它们的内在差异。事实上,RGB值捕获投影图像空间中的光度外观属性,而深度特征既编码局部几何的形状,也编码其在更大上下文中的基准(位置)。与基准相比,形状可能更具内在性,与语义的联系更强,因此对分割精度更为关键。受此观察启发,我们引入了一种形状感知卷积层(ShapeConv)来处理深度特征,其中深度特征首先被分解为形状分量和基准分量,接着引入两个可学习的权重分别与它们独立协作,最后在这两个分量重新加权组合的结果上应用卷积。ShapeConv与模型无关,可以轻松集成到大多数CNN中,以替代用于语义分割的普通卷积层。在三个具有挑战性的室内RGB-D语义分割基准数据集(即NYU-Dv2(-13,-40)、SUN RGB-D和SID)上的大量实验,证明了我们的ShapeConv在五种流行架构上的有效性。此外,使用ShapeConv的CNN在推理阶段不引入任何计算和内存增加的情况下提升了性能。其原因是,在ShapeConv中用于平衡形状和基准分量重要性的学习权重在推理阶段变为常数,因此可以融合到后续卷积中,从而得到一个与使用普通卷积层的网络相同的网络。
引用
@article{arxiv.2108.10528,
title = {ShapeConv: Shape-aware Convolutional Layer for Indoor RGB-D Semantic Segmentation},
author = {Jinming Cao and Hanchao Leng and Dani Lischinski and Danny Cohen-Or and Changhe Tu and Yangyan Li},
journal= {arXiv preprint arXiv:2108.10528},
year = {2021}
}
备注
ICCV2021