中文

用于RGB-D显著性目标检测的自监督预训练

计算机视觉与模式识别 2021-12-06 v4

摘要

现有基于CNN的RGB-D显著性目标检测(SOD)网络都需要在ImageNet上预训练以学习层次特征,从而提供良好的初始化。然而,大规模数据集的收集与标注耗时且昂贵。本文利用自监督表示学习(SSL)设计两个 pretext 任务:跨模态自编码器和深度轮廓估计。我们的 pretext 任务仅需少量无标注RGB-D数据集进行预训练,使网络捕获丰富语义上下文并缩小两模态间差距,从而为下游任务提供有效初始化。此外,针对RGB-D SOD中跨模态融合的固有问题,我们提出一致性-差异性聚合(CDA)模块,将单一特征融合拆分为多路径融合,以实现对一致与差异信息的充分感知。CDA模块具有通用性,适用于跨模态与跨层级特征融合。在六个基准数据集上的大量实验表明,我们的自监督预训练模型优于多数在ImageNet上预训练的SOTA方法。源代码将公开于 \textcolor{red}{\url{https://github.com/Xiaoqi-Zhao-DLUT/SSLSOD}}。

关键词

引用

@article{arxiv.2101.12482,
  title  = {Self-Supervised Pretraining for RGB-D Salient Object Detection},
  author = {Xiaoqi Zhao and Youwei Pang and Lihe Zhang and Huchuan Lu and Xiang Ruan},
  journal= {arXiv preprint arXiv:2101.12482},
  year   = {2021}
}

备注

This work was accepted by AAAI 2022