DiffPixelFormer:面向RGB-D室内场景分割的差分像素感知Transformer
计算机视觉与模式识别
2025-11-18 v1 机器人学
摘要
室内语义分割是计算机视觉和机器人学的基本任务,支持自动导航、增强现实和智能环境等应用。虽然RGB-D融合利用了表象和几何线索,但现有方法常依赖计算密集的跨注意力机制且不足以建模类内和类间特征关系,导致特征对齐不精确和判别表示受限。为此,我们提出DiffPixelFormer,一种用于RGB-D室内场景分割的差分像素感知Transformer,同时增强类内表征并建模类间相互作用。其核心是类内-类间模态交互块(IIMIB),通过自注意力捕获类内长程依赖,并通过差分共享跨模态(DSIM)模块建模类间相互作用,以解耦模态特定和共享线索,实现像素级精细跨模态对齐。此外,采用动态融合策略根据场景特征动态平衡模态贡献,充分利用RGB-D信息。在 SUN RGB-D 和 NYUDv2 数据集上的大量实验表明,DiffPixelFormer-L 在 mIoU 上分别达到 54.28% 和 59.95%,分别超过 DFormer-L 1.78% 和 2.75%。代码已公开于 https://github.com/gongyan1/DiffPixelFormer。
引用
@article{arxiv.2511.13047,
title = {DiffPixelFormer: Differential Pixel-Aware Transformer for RGB-D Indoor Scene Segmentation},
author = {Yan Gong and Jianli Lu and Yongsheng Gao and Jie Zhao and Xiaojuan Zhang and Susanto Rahardja},
journal= {arXiv preprint arXiv:2511.13047},
year = {2025}
}
备注
11 pages, 5 figures, 5 tables