中文

基于状态空间模型的全局感知单目语义场景补全

计算机视觉与模式识别 2025-03-11 v1

摘要

单目语义场景补全 (MonoSSC) 从单张图像重建并解释 3D 环境,支持多种现实世界应用。然而,现有方法常常受限于卷积神经网络 (CNN) 的局部感受野,难以处理投影点的不均匀分布(图 \ref{fig:perspective})并有效重建由 3D 到 2D 投影导致的缺失信息。在本工作中,我们引入了 GA-MonoSSC,一种用于 MonoSSC 的混合架构,能够有效捕捉 2D 图像域和 3D 空间中的全局上下文。具体而言,我们提出了一个双头多模态编码器,利用 Transformer 架构捕捉 2D 图像域中所有特征间的空间关系,从而实现更全面的 2D 特征提取。此外,我们引入了基于状态空间模型 (SSM) 的 Frustum Mamba 解码器,以高效捕捉 3D 空间中的长距离依赖关系。进一步地,我们在 Frustum Mamba 解码器内提出了一种视锥重排序策略,以缓解重排序体素序列中的特征不连续性,确保更好地与状态空间模型 (SSM) 的扫描机制对齐,从而改进 3D 表示学习。我们在广泛使用的 Occ-ScanNet 和 NYUv2 数据集上进行了大量实验,证明我们提出的方法实现了 SOTA 性能,验证了其有效性。代码将在论文被接收后发布。

关键词

引用

@article{arxiv.2503.06569,
  title  = {Global-Aware Monocular Semantic Scene Completion with State Space Models},
  author = {Shijie Li and Zhongyao Cheng and Rong Li and Shuai Li and Juergen Gall and Xun Xu and Xulei Yang},
  journal= {arXiv preprint arXiv:2503.06569},
  year   = {2025}
}