基于速度-精度权衡的轻量级 RGB-D 显著物体检测
计算机视觉与模式识别
2025-05-09 v1
摘要
当前 RGB-D 方法通常利用大规模 backbone 以提高精度,但牺牲了效率。而且,一些现有的轻量级方法难以实现高精度性能。为在效率和性能之间取得平衡,我们从深度质量、模态融合和特征表示三个基本角度提出了用于轻量级 RGB-D 显著物体检测的速度-精度权衡网络(SATNet)。就深度质量而言,我们引入 Depth Anything Model 生成高质量深度图,从而有效缓解当前数据集中的多模态鸿沟。就模态融合而言,我们提出了解耦注意力模块(DAM),用于探索单模态内以及跨模态之间的一致性。此处,将多模态特征解耦为双视图特征向量,以投影特征图中具辨识力的信息。就特征表示而言,我们开发了双向倒置框架的双信息表示模块(DIRM),以扩大轻量级 backbone 生成的受限特征空间。DIRM 模型用于纹理特征和显著性特征,以丰富特征空间,并利用双向预测头进行双向反向传播以优化其参数。最后,我们在解码器中设计了双特征聚合模块(DFAM),用于聚合纹理和显著性特征。广泛的实验表明,所提出的 SATNet 在五个公开 RGB-D 显著物体检测数据集上表现优异,超越了基于 CNN 的重量级最先进模型,同时实现轻量化框架,仅需 520 万参数,帧率达 415 FPS。
引用
@article{arxiv.2505.04758,
title = {Lightweight RGB-D Salient Object Detection from a Speed-Accuracy Tradeoff Perspective},
author = {Songsong Duan and Xi Yang and Nannan Wang and Xinbo Gao},
journal= {arXiv preprint arXiv:2505.04758},
year = {2025}
}
备注
Accepted by TIP 2025