中文

基于遮蔽循环网络的单目语义场景完成

计算机视觉与模式识别 2025-07-24 v1 机器人学

摘要

单目语义场景完成(Monocular Semantic Scene Completion, MSSC)旨在从单视图RGB图像中预测出基于体素的占据情况和语义类别。现有方法采用单阶段框架,旨在同时实现可见区域分割和遮挡区域幻觉,同时也受到深度估计不准确的影响。此类方法往往在复杂场景中达到次优性能。我们提出了一种新颖的两阶段框架,将MSSC分解为粗糙MSSC followed by 遮蔽循环网络。具体而言,我们提出了遮蔽稀疏门控循环单元(Masked Sparse Gated Recurrent Unit, MS-GRU),通过提出的mask更新机制集中注意力占据区域,同时提出稀疏GRU设计以降低计算成本。此外,我们提出距离注意力投影以通过根据距离到观察表面的不同注意力得分来减少投影误差。实验结果表明,我们提出的统一框架MonoMRN能够有效支持室内和户外场景,在NYUv2和SemanticKITTI数据集上达到最先进的性能。此外,我们在各种干扰条件下的鲁棒性分析凸显了遮蔽循环网络在增强模型对此类挑战韧性方面的作用。源代码已公开。

关键词

引用

@article{arxiv.2507.17661,
  title  = {Monocular Semantic Scene Completion via Masked Recurrent Networks},
  author = {Xuzhi Wang and Xinran Wu and Song Wang and Lingdong Kong and Ziping Zhao},
  journal= {arXiv preprint arXiv:2507.17661},
  year   = {2025}
}

备注

ICCV 2025; 15 pages, 10 figures, 6 tables; Code at https://github.com/alanWXZ/MonoMRN