中文

利用金字塔占据网络从图像预测语义地图表示

计算机视觉与模式识别 2020-03-31 v1

摘要

自动驾驶车辆通常依赖其环境的高精度鸟瞰地图,这些地图既捕获道路布局等静态场景元素,也捕获其他车辆与行人等动态元素。实时生成这些地图表示是一个复杂的多阶段过程,包含许多重要的基于视觉的环节,包括地平面估计、道路分割与3D目标检测。本文中,我们提出一种简单统一的端到端深度学习架构,直接从单目图像估计地图。对于地图本身,我们采用语义贝叶斯占据栅格框架,从而可轻易地在多相机与多时间步上累积信息。我们在NuScenes和Argoverse数据集上对比若干具有挑战性的基线评估了方法有效性,结果表明相较表现最佳的现有方法分别实现了9.1%和22.3%的相对提升。

关键词

引用

@article{arxiv.2003.13402,
  title  = {Predicting Semantic Map Representations from Images using Pyramid Occupancy Networks},
  author = {Thomas Roddick and Roberto Cipolla},
  journal= {arXiv preprint arXiv:2003.13402},
  year   = {2020}
}