中文

MonoOcc:深入探究单目语义占据预测

计算机视觉与模式识别 2024-03-14 v1

摘要

单目语义占据预测旨在仅从 2D 图像推断场景的完整 3D 几何与语义信息。它受到了广泛关注,特别是由于其具有增强自动驾驶车辆 3D 感知能力的潜力。然而,现有方法依赖复杂的级联框架,且用于恢复 3D 场景的信息相对有限,包括仅依赖对整个网络输出的监督、单帧输入以及使用小型骨干网络。这些挑战反过来阻碍了框架的优化,并导致较差的预测结果,特别是对于较小和长尾的物体。为了解决这些问题,我们提出了 MonoOcc。具体而言,我们 通过提出辅助语义损失作为对框架浅层的监督,以及一个图像条件的交叉注意力模块来利用视觉线索细化体素特征,从而改进单目占据预测框架; 采用蒸馏模块,将来自更大图像骨干网络的时间信息和更丰富的知识迁移到单目语义占据预测框架中,且硬件成本较低。凭借这些优势,我们的方法在基于相机的 SemanticKITTI Scene Completion 基准上取得了 SOTA 性能。代码和模型可在 https://github.com/ucaszyp/MonoOcc 获取

关键词

引用

@article{arxiv.2403.08766,
  title  = {MonoOcc: Digging into Monocular Semantic Occupancy Prediction},
  author = {Yupeng Zheng and Xiang Li and Pengfei Li and Yuhang Zheng and Bu Jin and Chengliang Zhong and Xiaoxiao Long and Hao Zhao and Qichao Zhang},
  journal= {arXiv preprint arXiv:2403.08766},
  year   = {2024}
}

备注

Accepted by ICRA 2024