MonoScene:单目 3D 语义场景补全
计算机视觉与模式识别
2022-03-30 v2 人工智能
机器人学
摘要
MonoScene 提出了一种 3D 语义场景补全(SSC)框架,其中场景的密集几何与语义由单张单目 RGB 图像推断得出。与依赖 2.5D 或 3D 输入的 SSC 文献不同,我们解决了 2D 到 3D 场景重建这一复杂问题,同时联合推断其语义。我们的框架依赖于连续的 2D 与 3D UNet,并通过一种受光学启发的新型 2D-3D 特征投影相连接,同时引入 3D 上下文关系先验以强化空间-语义一致性。除架构贡献外,我们提出了新颖的全局场景与局部视锥损失。实验表明,我们在所有指标与数据集上均优于现有文献,即便在相机视场之外也能幻觉出合理的景物。我们的代码与训练模型可在 https://github.com/cv-rits/MonoScene 获取。
引用
@article{arxiv.2112.00726,
title = {MonoScene: Monocular 3D Semantic Scene Completion},
author = {Anh-Quan Cao and Raoul de Charette},
journal= {arXiv preprint arXiv:2112.00726},
year = {2022}
}
备注
Accepted at CVPR 2022. Project page: https://cv-rits.github.io/MonoScene/