中文

MGNet:面向自动驾驶的单目几何场景理解

计算机视觉与模式识别 2025-03-11 v1

摘要

我们介绍了MGNet,一个用于单目几何场景理解的多任务框架。我们将单目几何场景理解定义为两个已知任务的组合:全景分割与自监督单目深度估计。全景分割不仅在语义上,而且以实例为基础捕获完整场景。自监督单目深度估计利用由相机测量模型导出的几何约束,仅从单目视频序列测量深度。据我们所知,我们首次提出将这两个任务组合于单一模型中。我们的模型设计侧重于低延迟,以在单个消费级GPU上实时快速推理。在部署期间,我们的模型从单张高分辨率相机图像生成带有实例感知语义标签的稠密3D点云。我们在两个流行的自动驾驶基准集(即Cityscapes和KITTI)上评估了我们的模型,并展现出与其他实时可行方法相比具有竞争力的性能。源代码可在 https://github.com/markusschoen/MGNet 获取。

关键词

引用

@article{arxiv.2206.13199,
  title  = {MGNet: Monocular Geometric Scene Understanding for Autonomous Driving},
  author = {Markus Schön and Michael Buchholz and Klaus Dietmayer},
  journal= {arXiv preprint arXiv:2206.13199},
  year   = {2025}
}