中文

基于三维卷积神经网络的 RGB-D 显著目标检测

计算机视觉与模式识别 2021-08-19 v1

摘要

RGB-D 显著目标检测 (SOD) 近来引起了越来越多的研究兴趣,许多基于编码器-解码器架构的深度学习方法相继出现。然而,大多数现有的 RGB-D SOD 模型仅在单一编码器或解码器阶段进行特征融合,难以保证充分的跨模态融合能力。在本文中,我们首次尝试通过三维卷积神经网络解决 RGB-D SOD 问题。所提出的模型名为 RD3D,旨在编码器阶段进行预融合并在解码器阶段进行深度融合,以有效促进 RGB 与深度流的完全整合。具体而言,RD3D 首先通过膨胀的三维编码器在 RGB 与深度模态间进行预融合,随后通过设计配备丰富反向投影路径 (RBPP) 的三维解码器提供深度特征融合,以利用三维卷积的广泛聚合能力。借助这种涉及编码器与解码器的渐进融合策略,可以挖掘两种模态间有效而彻底的交互并提升检测精度。在六个广泛使用的基准数据集上的大量实验表明,RD3D 在四项关键评价指标上优于 14 种最先进的 RGB-D SOD 方法。我们的代码将公开可用:https://github.com/PPOLYpubki/RD3D。

关键词

引用

@article{arxiv.2101.10241,
  title  = {RGB-D Salient Object Detection via 3D Convolutional Neural Networks},
  author = {Qian Chen and Ze Liu and Yi Zhang and Keren Fu and Qijun Zhao and Hongwei Du},
  journal= {arXiv preprint arXiv:2101.10241},
  year   = {2021}
}