BEVPose:通过位姿引导的多模态 BEV 对齐揭示场景语义
机器人学
2024-10-29 v1 计算机视觉与模式识别
摘要
在自动驾驶和移动机器人领域,创建鸟瞰图(BEV)表示的方法发生了显著转变。这种转变的特点是使用 Transformer 和学习将来自不同视觉传感器(主要是激光雷达和相机)的测量结果融合到一个二维平面地面表示中。然而,这些用于创建此类地图的基于学习的方法通常严重依赖大量标注数据,这带来了显著的挑战,特别是在大规模数据集稀缺的多样化或非城市环境中。在这项工作中,我们提出了 BEVPose,这是一个利用传感器位姿作为引导监督信号,整合来自相机和激光雷达数据的 BEV 表示的框架。该方法显著减少了对昂贵标注数据的依赖。通过利用位姿信息,我们对齐并融合多模态传感输入,促进了捕捉环境几何和语义方面的潜在 BEV 嵌入的学习。我们的预训练方法在 BEV 地图分割任务中表现出有前景的性能,优于完全监督的最先进方法,同时仅需极少量标注数据。这一进展不仅应对了 BEV 表示学习中的数据效率挑战,还拓宽了此类技术在包括越野和室内环境在内的各种领域中的应用潜力。
引用
@article{arxiv.2410.20969,
title = {BEVPose: Unveiling Scene Semantics through Pose-Guided Multi-Modal BEV Alignment},
author = {Mehdi Hosseinzadeh and Ian Reid},
journal= {arXiv preprint arXiv:2410.20969},
year = {2024}
}
备注
Accepted for presentation at the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), 2024. Project page: https://m80hz.github.io/bevpose/