Simple-BEV:多传感器 BEV 感知的关键所在是什么?
计算机视觉与模式识别
2022-10-03 v2
摘要
为自动驾驶车辆构建不依赖高密度 LiDAR 的 3D 感知系统是一个关键研究问题,因为与相机及其他传感器相比,LiDAR 系统成本高昂。近期研究开发了多种仅使用相机的方法,其特征被可微地“提升”自多相机图像至 2D 地平面,产生车辆周围 3D 空间的“鸟瞰图”(BEV)特征表示。这类工作产生了多种新颖的“提升”方法,但我们观察到训练设置中的其他细节同时也发生了变化,使得顶尖方法中真正关键的因素不明。我们还观察到,仅用相机并非真实世界的约束,因为诸如雷达等额外传感器已集成入实际车辆多年。本文中,我们首先试图阐明 BEV 感知模型设计与训练协议中的高影响因素。我们发现批大小与输入分辨率极大影响性能,而提升策略影响较温和——即便简单的无参数提升器也表现良好。其次,我们证明雷达数据可大幅提振性能,有助于缩小仅相机系统与启用 LiDAR 系统之间的差距。我们分析了带来良好性能的雷达使用细节,并邀请学界重新考量这一常被忽视的传感器平台部分。
引用
@article{arxiv.2206.07959,
title = {Simple-BEV: What Really Matters for Multi-Sensor BEV Perception?},
author = {Adam W. Harley and Zhaoyuan Fang and Jie Li and Rares Ambrus and Katerina Fragkiadaki},
journal= {arXiv preprint arXiv:2206.07959},
year = {2022}
}