中文

选择,而非融合:用于雷达-相机深度估计的雷达调制状态空间模型

计算机视觉与模式识别 2026-05-13 v1

摘要

雷达-相机深度估计必须将超稀疏、全天候、度量的雷达信号转换为密集的逐像素深度图。现有方法——拼接、置信度感知门控、稀疏监督、基于图的提取——在骨干网络的序列算子之外结合雷达和图像特征,甚至跨模态 Mamba 变体也使得选择机制本身保持单模态。我们认为选择机制是雷达介入的正确位置。我们引入了雷达调制选择(RMS),这是一种将雷达注入 Mamba 选择性扫描的最小且原则性的方法:雷达从内部调制扫描,向步长 Δ\Delta 和读出 C\mathbf{C} 添加零初始化的扰动,同时保持输入投影 B\mathbf{B} 和状态动态 A\mathbf{A} 仅来自图像。该构造在初始化时完全等价于预训练的纯图像 Mamba,确保雷达仅在提高精度的地方影响模型。由此产生了扫描外融合无法提供的两个进一步特性:每个循环步骤的线性成本跨模态耦合,以及当雷达缺失时自然回退到纯图像骨干网络。我们将 RMS 部署在一个多视图扫描金字塔(MVSP)中,该金字塔在每个尺度上将融合算子与雷达的空间覆盖范围相匹配。SemoDepth 在 nuScenes 上实现了最先进的性能,在 0-50、0-70 和 0-80 米范围内,MAE 分别比之前的最佳结果降低了 34.0%、29.9% 和 29.9%,同时实现了最低的单帧延迟(26.8 毫秒)。进一步的消融研究表明,扫描外特征混合在 RMS 之上没有增加任何精度,这为扫描内选择可以替代扫描外融合提供了实证验证。

关键词

引用

@article{arxiv.2605.11840,
  title  = {Selection, Not Fusion: Radar-Modulated State Space Models for Radar-Camera Depth Estimation},
  author = {Zhangcheng Hou and Tomoaki Ohtsuki},
  journal= {arXiv preprint arXiv:2605.11840},
  year   = {2026}
}

备注

16 pages, 3 figures, 9 tables