DFormer:重新思考面向语义分割的 RGBD 表征学习
计算机视觉与模式识别
2024-02-08 v2
摘要
我们提出 DFormer,一种新颖的 RGB-D 预训练框架,用于学习可迁移的 RGB-D 分割任务表征。DFormer 有两个关键创新:1) 与以往用 RGB 预训练骨干编码 RGB-D 信息不同,我们使用来自 ImageNet-1K 的图像-深度对预训练骨干,从而赋予 DFormer 编码 RGB-D 表征的能力;2) DFormer 由一系列 RGB-D 块组成,通过新颖的基础模块设计定制以编码 RGB 与深度信息。DFormer 避免了 RGB 预训练骨干对深度图中 3D 几何关系的不匹配编码,该问题广泛存在于现有方法中却尚未解决。我们以轻量解码头在两个流行的 RGB-D 任务(即 RGB-D 语义分割与 RGB-D 显著目标检测)上微调预训练 DFormer。实验结果表明,我们的 DFormer 在这两个任务上以不到当前最佳方法一半的计算成本,在两个 RGB-D 语义分割数据集与五个 RGB-D 显著目标检测数据集上取得了新的 SOTA 性能。代码见:https://github.com/VCIP-RGBD/DFormer。
引用
@article{arxiv.2309.09668,
title = {DFormer: Rethinking RGBD Representation Learning for Semantic Segmentation},
author = {Bowen Yin and Xuying Zhang and Zhongyu Li and Li Liu and Ming-Ming Cheng and Qibin Hou},
journal= {arXiv preprint arXiv:2309.09668},
year = {2024}
}
备注
Accepted by ICLR 2024