RGB-D 视频中的显著目标检测
计算机视觉与模式识别
2024-05-22 v2
摘要
鉴于深度感知采集设备的广泛采用,RGB-D 视频及相关数据/媒体在日常生活的各个方面获得了相当大的关注。因此,在 RGB-D 视频中进行显著目标检测(SOD)呈现出一条极具前景且不断发展的途径。尽管该领域有潜力,RGB-D 视频中的 SOD 仍未被充分探索,RGB-D SOD 与视频 SOD(VSOD)传统上被孤立研究。为探索这一新兴领域,本文做出两项主要贡献:数据集与模型。一方面,我们构建了 RDVS 数据集,一个具有真实深度、以场景多样性和严格逐帧标注为特征的新型 RGB-D VSOD 数据集。我们通过全面的属性与面向对象分析验证了该数据集,并给出了训练与测试划分。此外,我们引入 DCTNet+,一个为 RGB-D VSOD 定制的三个分支的网络,以 RGB 模态为主,将深度与光流视为辅助模态。为实现精确最终预测的有效特征增强、细化与融合,我们提出两个模块:多模态注意力模块(MAM)与细化融合模块(RFM)。为增强 RFM 内的交互与融合,我们设计了通用交互模块(UIM),随后整合整体多模态注意力路径(HMAPs),以在到达 RFM 前细化多模态低级特征。在伪 RGB-D 视频数据集及我们的 RDVS 上进行的综合实验,凸显了 DCTNet+ 优于 17 个 VSOD 模型与 14 个 RGB-D SOD 模型。在伪与真实 RGB-D 视频数据集上进行的消融实验证明了各模块的优势及引入真实深度的必要性。我们的代码与 RDVS 数据集将发布于 https://github.com/kerenfu/RDVS/。
引用
@article{arxiv.2310.15482,
title = {Salient Object Detection in RGB-D Videos},
author = {Ao Mou and Yukang Lu and Jiahao He and Dingyao Min and Keren Fu and Qijun Zhao},
journal= {arXiv preprint arXiv:2310.15482},
year = {2024}
}
备注
IEEE TIP (under major revision)