用于RGB-D语义分割的像素差分卷积网络
计算机视觉与模式识别
2023-02-24 v1
摘要
得益于深度数据的可用性,RGB-D 语义分割可借助卷积神经网络取得进展。尽管仅凭 2D 外观难以区分物体,但利用深度中的局部像素差异与几何模式,在某些情况下可将其良好分离。考虑到固定的网格核结构,CNN 受限于缺乏捕捉细致、细粒度信息的能力,因而无法实现准确的像素级语义分割。为解决该问题,我们提出像素差分卷积网络(PDCNet),通过分别聚合深度数据局部范围的强度与梯度信息、以及 RGB 数据全局范围的强度与梯度信息,来捕捉细致的内在模式。具体而言,PDCNet 由深度分支与 RGB 分支构成。对于深度分支,我们提出像素差分卷积(PDC),通过聚合强度与梯度信息来考虑深度数据中的局部与细致几何信息。对于 RGB 分支,我们贡献轻量级级联大核(CLK)以扩展 PDC,即 CPDC,从而利用 RGB 数据的全局上下文并进一步提升性能。由此,两种模态数据的局部与全局像素差异在信息传播过程中被无缝整合进 PDCNet。在两个具挑战性的基准数据集 NYUDv2 与 SUN RGB-D 上的实验表明,我们的 PDCNet 在语义分割任务上取得了最先进(SOTA)性能。
引用
@article{arxiv.2302.11951,
title = {Pixel Difference Convolutional Network for RGB-D Semantic Segmentation},
author = {Jun Yang and Lizhi Bai and Yaoru Sun and Chunqi Tian and Maoyu Mao and Guorun Wang},
journal= {arXiv preprint arXiv:2302.11951},
year = {2023}
}