中文

重新思考 RGB-D 显著性目标检测:模型、数据集与大规模基准

计算机视觉与模式识别 2024-02-21 v2

摘要

近年来,利用 RGB-D 信息进行显著性目标检测已得到广泛探索。然而,针对真实世界人类活动场景中 RGB-D 显著性目标检测的建模工作相对较少。本文通过以下对 RGB-D 显著性目标检测的贡献填补了这一空白。(1)我们精心收集了一个新的 SIP(显著行人)数据集,包含约 1K 高分辨率图像,涵盖来自不同视角、姿态、遮挡、光照和背景的多样真实场景。(2)我们进行了大规模(且迄今为止最全面的)基准比较,对比了当代方法,该基准长期缺失于该领域,可作为未来研究的基线。我们系统总结了 32 种流行模型,并在七个数据集(共约 97K 图像)上评估了 32 种模型中的 18 个部分。(3)我们提出了一种称为深度深度净化网络(D3Net)的简单通用架构。它由深度净化单元(DDU)和三流特征学习模块(FLM)组成,分别执行低质量深度图滤波和跨模态特征学习。这些组件形成嵌套结构,并精心设计为联合学习。D3Net 在所考虑的所有五个指标上均超越以往任何竞争方法的性能,从而作为推动该领域研究的强模型。我们还展示了 D3Net 可用于从真实场景中高效提取显著目标掩码,在单个 GPU 上以 65fps 的速度实现有效的背景替换应用。所有显著性图、我们的新 SIP 数据集、D3Net 模型和评估工具均公开于 https://github.com/DengPingFan/D3NetBenchmark。

关键词

引用

@article{arxiv.1907.06781,
  title  = {Rethinking RGB-D Salient Object Detection: Models, Data Sets, and Large-Scale Benchmarks},
  author = {Deng-Ping Fan and Zheng Lin and Jia-Xing Zhao and Yun Liu and Zhao Zhang and Qibin Hou and Menglong Zhu and Ming-Ming Cheng},
  journal= {arXiv preprint arXiv:1907.06781},
  year   = {2024}
}

备注

Accepted in TNNLS20. 15 pages, 12 figures. Code: https://github.com/DengPingFan/D3NetBenchmark