中文

投影-融合:通过图卷积网络提高RGB-D语义分割

计算机视觉与模式识别 2025-05-05 v3

摘要

大多数现有RGB-D语义分割方法侧重于特征层级融合,包括复杂的跨模态和跨尺度融合模块。然而,这些方法可能在特征融合过程中导致错位问题,并在分割结果中产生不合理的块状区域。灵感来源于流行的像素-节点-像素管线,我们提出 (1) 以晚期融合方式融合两种模态的特征,其中几何特征注入由纹理特征先验指导; (2) 在融合特征上采用图神经网络(GNN),以缓解不规则块区域的出现,通过推断像素之间的关系来实现。对于3D特征提取阶段,我们认为传统CNN对深度图的效率不够。因此,我们将深度图编码为法线图,随后CNN可以轻松提取物体表面趋势。在投影矩阵生成阶段,我们发现原始管线中存在Biased-Assignment和Ambiguous-Locality问题。因此,我们提出 (1) 采用Kullback-Leibler Loss以确保不会遗漏重要像素特征,可视为硬像素挖掘过程; (2) 将在欧几里得空间和语义空间中彼此靠近的区域连接起来,以更大的边权重方式,以便考虑位置信息。在NYU-DepthV2和SUN RGB-D两个公开数据集上进行大量实验,结果表明,我们的方法在RGB-D语义分割任务中持续提升了性能。

关键词

引用

@article{arxiv.2501.18851,
  title  = {Project-and-Fuse: Improving RGB-D Semantic Segmentation via Graph Convolution Networks},
  author = {Xiaoyan Jiang and Bohan Wang and Xinlong Wan and Shanshan Chen and Hamido Fujita and Hanan Abd. Al Juaid},
  journal= {arXiv preprint arXiv:2501.18851},
  year   = {2025}
}

备注

I have decided to withdraw this paper because I have recently obtained some new data and insights during my ongoing research