中文

基于几何提示学习的 RGB-D 语义分割:在深度缺失和退化情况下的适应

计算机视觉与模式识别 2026-04-14 v1 机器人学

摘要

机器人和具身 AI 的多模态感知系统通常假设可靠的 RGB-D 感知,但实际情况下,深度数据常常缺失、噪声或损坏。为此,我们提出了 GeomPrompt,一个轻量级的跨模态适应模块,从 RGB 单张图像合成针对分割任务驱动的几何提示,用于深度frozen RGB-D 语义分割模型的第四通道,无需深度监督。我们进一步引入了 GeomPrompt-Recovery,一个适应模块,通过预测第四通道的校正项来补偿退化深度,而非估计深度信号。两个模块仅依据下游分割监督进行训练,实现对有用几何先验的恢复,而非深度信号的估计。在 SUN RGB-D 数据集上,GeomPrompt 在 DFormer 和 GeminiFusion 上的 mIoU 分别提升 6.1 和 3.0,同时保持对强单目深度估计器的竞争性。对于退化深度,GeomPrompt-Recovery 能稳健地提高鲁棒性,在严重深度损坏情况下可提升最高 3.6 mIoU。GeomPrompt 也显著高效于单目深度基线,延迟仅为 7.8 毫秒,而分别为 38.3 毫秒和 71.9 毫秒。这些结果表明,任务驱动的几何提示是跨模态在深度缺失和退化输入下进行感知适应的高效机制。

关键词

引用

@article{arxiv.2604.11585,
  title  = {GeomPrompt: Geometric Prompt Learning for RGB-D Semantic Segmentation Under Missing and Degraded Depth},
  author = {Krishna Jaganathan and Patricio Vela},
  journal= {arXiv preprint arXiv:2604.11585},
  year   = {2026}
}

备注

Accepted to the CVPR 2026 URVIS Workshop. Project page: https://geomprompt.github.io