面向高效 RGB-D 与视频显著性目标检测的深度质量启发特征操控
计算机视觉与模式识别
2022-12-14 v2
摘要
近来基于 CNN 的 RGB-D 显著性目标检测(SOD)在检测精度上取得显著提升。然而,现有模型常难以同时兼顾效率与精度,阻碍了其在移动设备以及诸多现实问题中的潜在应用。为弥合轻量与大型 RGB-D SOD 模型间的精度差距,本文提出一种高效模块,可大幅提升精度而仅增加极少计算量。受深度质量是影响精度的关键因素这一事实启发,我们提出高效的深度质量启发特征操控(DQFM)过程,可根据深度质量动态过滤深度特征。所提 DQFM 借助低层 RGB 与深度特征的对齐,以及深度流的全局注意力,来显式控制并增强跨模态融合。我们将 DQFM 嵌入以获得称为 DFM-Net 的高效轻量 RGB-D SOD 模型,其中还设计了定制深度骨干与两阶段解码器作为基本部件。在九个 RGB-D 数据集上的大量实验表明,我们的 DFM-Net 优于近期高效模型,在 CPU 上以约 20 FPS 运行且模型大小仅 8.5Mb,同时比最新最佳模型 A2dele 和 MobileSal 快 2.9/2.4 倍、小 6.7/3.1 倍。即便与非高效模型相比,它也保持最先进精度。有趣的是,进一步统计与分析验证了 DQFM 在无任何质量标签下区分不同质量深度图的能力。最后,我们进一步将 DFM-Net 应用于视频 SOD(VSOD),取得与近期高效模型相当的性能,同时比该领域先前最佳快 3/2.3 倍、小 3/2.3 倍。代码见 https://github.com/zwbx/DFM-Net。
引用
@article{arxiv.2208.03918,
title = {Depth Quality-Inspired Feature Manipulation for Efficient RGB-D and Video Salient Object Detection},
author = {Wenbo Zhang and Keren Fu and Zhuo Wang and Ge-Peng Ji and Qijun Zhao},
journal= {arXiv preprint arXiv:2208.03918},
year = {2022}
}
备注
arXiv admin note: substantial text overlap with arXiv:2107.01779