BEVerse:面向以视觉为中心的自动驾驶的鸟瞰图统一感知与预测
计算机视觉与模式识别
2022-05-20 v1
摘要
本文提出 BEVerse,一个基于多相机系统的 3D 感知与预测统一框架。不同于现有聚焦于改进单任务方法的研究,BEVerse 的特点是从多相机视频生成时空鸟瞰图(BEV)表示,并联合推理以视觉为中心的自动驾驶的多个任务。具体而言,BEVerse 首先执行共享特征提取与提升,从多时间戳和多视角图像生成 4D BEV 表示。在自车运动对齐之后,时空编码器用于在 BEV 中进一步提取特征。最后,接入多个任务解码器进行联合推理与预测。在解码器中,我们提出网格采样器以生成具有不同范围和粒度、面向不同任务的 BEV 特征。同时,我们设计了迭代流方法以实现内存高效的未来预测。我们表明时序信息改善了 3D 目标检测与语义地图构建,而多任务学习可隐式惠及运动预测。在 nuScenes 数据集上的大量实验表明,多任务 BEVerse 在 3D 目标检测、语义地图构建和运动预测上优于现有单任务方法。与顺序范式相比,BEVerse 还显著提升了效率。代码与训练模型将发布于 https://github.com/zhangyp15/BEVerse。
引用
@article{arxiv.2205.09743,
title = {BEVerse: Unified Perception and Prediction in Birds-Eye-View for Vision-Centric Autonomous Driving},
author = {Yunpeng Zhang and Zheng Zhu and Wenzhao Zheng and Junjie Huang and Guan Huang and Jie Zhou and Jiwen Lu},
journal= {arXiv preprint arXiv:2205.09743},
year = {2022}
}
备注
Code: https://github.com/zhangyp15/BEVerse