DFormerv2:面向 RGBD 语义分割的几何自注意力
计算机视觉与模式识别
2025-04-08 v1
摘要
得益于深度图所提供的三维几何信息,场景理解领域的最新进展在复杂条件(如低光照和过曝)下取得了显著提升。现有方法通常将深度图与 RGB 图像一同编码,并在二者之间进行特征融合,以实现更鲁棒的预测。考虑到深度可被视为 RGB 图像的几何补充,一个直观的问题随之浮现:我们是否真的需要像处理 RGB 图像那样,用神经网络显式地对深度信息进行编码?基于这一洞察,本文探索了一种学习 RGBD 特征表示的新方法,并提出了 DFormerv2——一个强大的 RGBD 编码器,它将深度图显式地用作几何先验,而非用神经网络对深度信息进行编码。我们的目标是从深度以及所有图像块 token 之间的空间距离中提取几何线索,并将其作为几何先验来分配自注意力中的注意力权重。大量实验表明,DFormerv2 在多种 RGBD 语义分割基准上表现出卓越的性能。代码已开源,地址为:https://github.com/VCIP-RGBD/DFormer。
引用
@article{arxiv.2504.04701,
title = {DFormerv2: Geometry Self-Attention for RGBD Semantic Segmentation},
author = {Bo-Wen Yin and Jiao-Long Cao and Ming-Ming Cheng and Qibin Hou},
journal= {arXiv preprint arXiv:2504.04701},
year = {2025}
}
备注
Accepted by CVPR 2025