TempBEV: Improving Learned BEV Encoders with Combined Image and BEV Space Temporal Aggregation
计算机视觉与模式识别
2024-09-20 v2 人工智能
机器学习
机器人学
摘要
自动驾驶需要准确的环境表示。提高精度的一个策略是融合来自多个传感器的数据。以太鸟眼视图(BEV)编码器通过将来自单个传感器的数据映射到一个联合潜空间来实现这一点,可实现对不同视角多个摄像头数据的有效融合。对于成本效益高的仅用摄像头的系统,这提供了一种有效的机制来融合来自多个摄像头的数据。准确度还可通过对时间上的传感器信息进行聚合来进一步提高。这在单目摄像头系统中尤为重要,因为该系统缺乏显式的深度和速度测量。因此,已开发的 BEV 编码器的有效性关键取决于用于聚合时间信息的算子以及所使用的潜表示空间。我们分析了文献中提出的 BEV 编码器,并比较了其有效性,量化了聚合算子和潜表示空间的影响。虽然大多数现有方法要么在图像空间,要么在 BEV 潜空间中聚合时间信息,但我们的分析和性能比较表明,这些潜表示具有互补的优势。因此,我们开发了一种新型的时间 BEV 编码器 TempBEV,将来自两种潜空间中聚合的时间信息相互结合。我们将后续图像帧视为通过时间的立体图像,并利用光流估计方法进行时间立体编码。在 NuScenes 数据集上的经验评估表明,TempBEV 对 3D 对象检测和 BEV 分割均显著优于基线方法。消融实验揭示了图像和 BEV 潜空间中联合时间聚合之间存在强大的协同作用。这些结果表明我们方法的总体有效性,并为在两种图像和 BEV 潜空间中聚合时间信息提供了有力论据。
引用
@article{arxiv.2404.11803,
title = {TempBEV: Improving Learned BEV Encoders with Combined Image and BEV Space Temporal Aggregation},
author = {Thomas Monninger and Vandana Dokkadi and Md Zafar Anwar and Steffen Staab},
journal= {arXiv preprint arXiv:2404.11803},
year = {2024}
}
备注
Accepted for 2024 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2024)