基于可变形注意力转换器的扩散 RGB-D 语义分割
计算机视觉与模式识别
2025-10-13 v3
摘要
基于视觉的感知与推理是理解任何自主系统场景的关键。RGB 图像和深度图像通常用于捕获环境的语义特征和几何特征。开发可靠解释此类数据的关键方法至关重要,实际应用中往往不可避免地存在噪声测量。本文引入了一个基于扩散模型的框架来解决 RGB-D 语义分割问题。此外,我们演示了将可变形注意力转换器作为编码器从深度图像中提取特征,能够有效捕获深度测量中无效区域的特征。我们的生成框架具有更大的容量来建模 RGB-D 图像的底层分布,在面对具有挑战性场景时能够显著减少训练时间。实验结果表明,我们的方法在 NYUv2 和 SUN-RGBD 数据集上实现了状态的最佳性能,尤其在其最具挑战性的图像数据方面表现尤为突出。我们的项目页面将在 https://diffusionmms.github.io/ 上提供。
关键词
引用
@article{arxiv.2409.15117,
title = {Diffusion-based RGB-D Semantic Segmentation with Deformable Attention Transformer},
author = {Minh Bui and Kostas Alexis},
journal= {arXiv preprint arXiv:2409.15117},
year = {2025}
}