中文

JPerceiver:面向驾驶场景深度、位姿与布局估计的联合感知网络

计算机视觉与模式识别 2022-07-19 v1

摘要

深度估计、视觉里程计(VO)和鸟瞰图(BEV)场景布局估计是驾驶场景感知的三个关键任务,是自动驾驶中运动规划与导航的基础。尽管它们互为补充,已有工作通常聚焦于单个任务,很少同时处理这三个任务。一种朴素的方法是顺序或并行地独立完成它们,但存在诸多缺陷,即:1) 深度和VO结果受固有的尺度模糊问题影响;2) BEV布局直接由前视图像预测而未使用任何深度相关信息,尽管深度图包含用于推断场景布局的有用几何线索。本文中,我们通过提出一种名为JPerceiver的新型联合感知框架来解决这些问题,该框架可从单目视频序列同时估计尺度感知的深度与VO以及BEV布局。它利用跨视角几何变换(CGT)基于精心设计的尺度损失将绝对尺度从道路布局传播至深度和VO。同时,设计了一个跨视角跨模态传递(CCT)模块,通过注意力机制利用深度线索推理道路与车辆布局。JPerceiver可以以端到端多任务学习方式进行训练,其中CGT尺度损失与CCT模块促进任务间知识传递,利于各任务的特征学习。在Argoverse、Nuscenes和KITTI上的实验表明,JPerceiver在上述三个任务上的精度、模型大小和推理速度均优于现有方法。代码与模型见~\href{https://github.com/sunnyHelen/JPerceiver}{https://github.com/sunnyHelen/JPerceiver}。

关键词

引用

@article{arxiv.2207.07895,
  title  = {JPerceiver: Joint Perception Network for Depth, Pose and Layout Estimation in Driving Scenes},
  author = {Haimei Zhao and Jing Zhang and Sen Zhang and Dacheng Tao},
  journal= {arXiv preprint arXiv:2207.07895},
  year   = {2022}
}

备注

Accepted by ECCV 2022