中文

MGNiceNet:统一的单目几何场景理解

计算机视觉与模式识别 2025-03-11 v2

摘要

单目几何场景理解结合了全景分割与自监督深度估计,专注于自动驾驶中的实时应用。我们提出了 MGNiceNet,这是一种统一的方法,使用连接核公式进行全景分割和自监督深度估计。MGNiceNet 基于最先进的实时全景分割方法 RT-K-Net,并将该架构扩展以同时涵盖全景分割和自监督单目深度估计。为此,我们引入了一个紧耦合的自监督深度估计预测器,该预测器显式利用来自全景路径的信息进行深度预测。此外,我们引入了一种全景引导的运动掩码方法,在不依赖视频全景分割标注的情况下改进深度估计。我们在两个流行的自动驾驶数据集 Cityscapes 和 KITTI 上评估了我们的方法。与其他实时方法相比,我们的模型展示了最先进的性能,并缩小了与计算需求更高的方法之间的差距。源代码和训练好的模型可在 https://github.com/markusschoen/MGNiceNet 获取。

关键词

引用

@article{arxiv.2411.11466,
  title  = {MGNiceNet: Unified Monocular Geometric Scene Understanding},
  author = {Markus Schön and Michael Buchholz and Klaus Dietmayer},
  journal= {arXiv preprint arXiv:2411.11466},
  year   = {2025}
}