深度至关重要:探索交通场景语义分割中 RGB-D 的深度交互
计算机视觉与模式识别
2025-07-02 v2
摘要
RGB-D 已逐渐成为辅助驾驶中理解复杂场景的关键数据源。然而,现有研究对深度图的内在空间属性关注不足。这一疏忽显著影响了注意力表示,导致因注意力偏移问题而引发预测错误。为此,我们提出了一种新颖的可学习深度交互金字塔 Transformer(DiPFormer),以探索深度的有效性。首先,我们引入深度空间感知优化(Depth SAO)作为偏移量来表示现实世界的空间关系。其次,通过深度线性交叉注意力(Depth LCA)学习 RGB-D 在特征空间中的相似性,以在像素级澄清空间差异。最后,利用 MLP 解码器有效融合多尺度特征,以满足实时性要求。综合实验表明,所提出的 DiPFormer 显著解决了道路检测(+7.5%)和语义分割(+4.9% / +1.5%)任务中的注意力不对齐问题。DiPFormer 在 KITTI(KITTI road 上 F-score 为 97.57%,KITTI-360 上 mIoU 为 68.74%)和 Cityscapes(mIoU 为 83.4%)数据集上取得了 state-of-the-art 的性能。
引用
@article{arxiv.2409.07995,
title = {Depth Matters: Exploring Deep Interactions of RGB-D for Semantic Segmentation in Traffic Scenes},
author = {Siyu Chen and Ting Han and Changshe Zhang and Weiquan Liu and Jinhe Su and Zongyue Wang and Guorong Cai},
journal= {arXiv preprint arXiv:2409.07995},
year = {2025}
}
备注
Accepted by IROS 2025