中文

可塑 2.5D 卷积:沿深度轴学习感受野用于 RGB-D 场景解析

计算机视觉与模式识别 2020-07-21 v1

摘要

深度数据提供几何信息,可推动 RGB-D 场景解析任务的进展。近期的若干工作提出了 RGB-D 卷积算子,沿深度轴构建感受野以处理像素间的 3D 邻域关系。然而,这些方法通过超参数预定义深度感受野,使其依赖于参数选择。本文提出一种称为可塑 2.5D 卷积的新型算子,沿深度轴学习感受野。可塑 2.5D 卷积具有一个或多个 2D 卷积核。我们的方法根据各像素的相对深度差将其分配给其中一个核或不分配给任何核,且该分配过程被表述为可微分形式,从而可通过梯度下降学习。所提算子运行于标准 2D 特征图上,并可无缝集成到预训练的 CNN 中。我们在两个具挑战性的 RGB-D 语义分割数据集 NYUDv2 和 Cityscapes 上进行了广泛实验,以验证方法的有效性与泛化能力。

关键词

引用

@article{arxiv.2007.09365,
  title  = {Malleable 2.5D Convolution: Learning Receptive Fields along the Depth-axis for RGB-D Scene Parsing},
  author = {Yajie Xing and Jingbo Wang and Gang Zeng},
  journal= {arXiv preprint arXiv:2007.09365},
  year   = {2020}
}

备注

ECCV 2020