Zero-BEV:将任意第一人称模态零样本投影至 BEV 地图
计算机视觉与模式识别
2024-03-26 v2 机器人学
摘要
鸟瞰图(BEV)地图是一种重要的几何结构化表示,广泛应用于机器人领域,特别是自动驾驶车辆和地面机器人。现有算法要么需要几何投影的深度信息(这些信息并非总是可靠可用),要么以全监督方式端到端训练,将视觉第一人称观测映射到 BEV 表示,因此受限于其训练时的输出模态。相比之下,我们提出了一种新模型,能够将从第一人称视角可用的任何模态零样本投影到相应的 BEV 地图。这是通过将几何逆透视投影与模态变换(例如从 RGB 到占据栅格)解耦来实现的。该方法具有通用性,我们展示了将三种不同模态投影到 BEV 的实验结果:在第一人称视角检测到的语义分割、运动矢量和物体边界框。实验表明,该模型优于竞争方法,特别是优于广泛使用的依赖单目深度估计的基线方法。
引用
@article{arxiv.2402.13848,
title = {Zero-BEV: Zero-shot Projection of Any First-Person Modality to BEV Maps},
author = {Gianluca Monaci and Leonid Antsfeld and Boris Chidlovskii and Christian Wolf},
journal= {arXiv preprint arXiv:2402.13848},
year = {2024}
}