通过级联互信息最小化进行 RGB-D 显著性检测
计算机视觉与模式识别
2022-01-07 v2
摘要
现有的 RGB-D 显著性检测模型并未显式地促使 RGB 与深度实现有效的多模态学习。本文中,我们引入了一种通过互信息最小化的多阶段级联学习框架,以“显式”建模 RGB 图像与深度数据之间的多模态信息。具体而言,我们首先将每种模态的特征映射为较低维特征向量,并采用互信息最小化作为正则化项以减少来自 RGB 的外观特征与来自深度的几何特征间的冗余。随后我们进行多阶段级联学习,在网络每一阶段施加互信息最小化约束。在基准 RGB-D 显著性数据集上的大量实验说明了我们框架的有效性。此外,为推动该领域发展,我们贡献了最大的数据集(比 NJU2K 大 7 倍),包含 15,625 对具有高质量多边形-/涂鸦-/目标-/实例-/排序级标注的图像。基于这些丰富标签,我们额外构建了四个带强基线的新基准,并观察到一些有趣现象,可启发未来的模型设计。源代码与数据集可在 “https://github.com/JingZhang617/cascaded_rgbd_sod” 获取。
引用
@article{arxiv.2109.07246,
title = {RGB-D Saliency Detection via Cascaded Mutual Information Minimization},
author = {Jing Zhang and Deng-Ping Fan and Yuchao Dai and Xin Yu and Yiran Zhong and Nick Barnes and Ling Shao},
journal= {arXiv preprint arXiv:2109.07246},
year = {2022}
}
备注
Accepted as ICCV2021 paper