中文

基于前视到顶视投影的单目鸟瞰道路场景感知

计算机视觉与模式识别 2022-11-16 v1

摘要

高精地图重建对自动驾驶至关重要。基于 LiDAR 的方法受限于昂贵传感器与耗时计算。基于相机的方法通常需要分别进行道路分割与视图变换,这常导致畸变与内容缺失。为推进技术极限,我们提出一种新颖框架,仅给定前视单目图像即可重建由道路布局与车辆占据组成的鸟瞰(bird's-eye view)局部地图。我们提出前视到顶视投影(FTVP)模块,其考虑视图间循环一致性约束,并充分利用其相关性以增强视图变换与场景理解。此外,我们还应用多尺度 FTVP 模块将低级特征的丰富空间信息传播以缓解预测物体位置的空间偏差。在公开基准上的实验表明,我们的方法在道路布局估计、车辆占据估计和多类语义估计任务中达到了最优(state-of-the-art)性能。特别是在多类语义估计中,我们的模型大幅优于所有竞争对手。此外,我们的模型在单 GPU 上以 25 FPS 运行,高效且适用于实时全景高精地图重建。

关键词

引用

@article{arxiv.2211.08144,
  title  = {Monocular BEV Perception of Road Scenes via Front-to-Top View Projection},
  author = {Wenxi Liu and Qi Li and Weixiang Yang and Jiaxin Cai and Yuanlong Yu and Yuexin Ma and Shengfeng He and Jia Pan},
  journal= {arXiv preprint arXiv:2211.08144},
  year   = {2022}
}

备注

Extension to CVPR'21 paper "Projecting Your View Attentively: Monocular Road Scene Layout Estimation via Cross-View Transformation"