CIR-Net:面向RGB-D显著性目标检测的跨模态交互与精炼
计算机视觉与模式识别
2022-11-23 v1
摘要
针对RGB-D显著性目标检测(SOD)任务中如何有效捕获并利用跨模态信息的问题,我们提出一种基于新颖跨模态交互与精炼的卷积神经网络(CNN)模型,称为CIR-Net。对于跨模态交互,1)提出渐进注意力引导整合单元以在编码阶段充分整合RGB-D特征表示,2)提出收敛聚合结构,在解码阶段通过重要性门控融合单元将RGB与深度解码特征流入相应的RGB-D解码流。对于跨模态精炼,我们在编码器与解码器间插入精炼中间件结构,其中RGB、深度与RGB-D编码器特征通过依次使用自模态注意力精炼单元与跨模态加权精炼单元被进一步精炼。最终,利用逐步精炼的特征,我们在解码阶段预测显著性图。在六个流行RGB-D SOD基准上的大量实验表明,我们的网络在定性与定量上均优于最先进(state-of-the-art, SOTA)显著性检测器。
引用
@article{arxiv.2210.02843,
title = {CIR-Net: Cross-modality Interaction and Refinement for RGB-D Salient Object Detection},
author = {Runmin Cong and Qinwei Lin and Chen Zhang and Chongyi Li and Xiaochun Cao and Qingming Huang and Yao Zhao},
journal= {arXiv preprint arXiv:2210.02843},
year = {2022}
}
备注
Accepted by IEEE Transactions on Image Processing 2022, 16 pages, 11 figures