中文

Zero-BEV:将任意第一人称模态零样本投影至 BEV 地图

计算机视觉与模式识别 2024-03-26 v2 机器人学

摘要

鸟瞰图(BEV)地图是一种重要的几何结构化表示,广泛应用于机器人领域,特别是自动驾驶车辆和地面机器人。现有算法要么需要几何投影的深度信息(这些信息并非总是可靠可用),要么以全监督方式端到端训练,将视觉第一人称观测映射到 BEV 表示,因此受限于其训练时的输出模态。相比之下,我们提出了一种新模型,能够将从第一人称视角可用的任何模态零样本投影到相应的 BEV 地图。这是通过将几何逆透视投影与模态变换(例如从 RGB 到占据栅格)解耦来实现的。该方法具有通用性,我们展示了将三种不同模态投影到 BEV 的实验结果:在第一人称视角检测到的语义分割、运动矢量和物体边界框。实验表明,该模型优于竞争方法,特别是优于广泛使用的依赖单目深度估计的基线方法。

关键词

引用

@article{arxiv.2402.13848,
  title  = {Zero-BEV: Zero-shot Projection of Any First-Person Modality to BEV Maps},
  author = {Gianluca Monaci and Leonid Antsfeld and Boris Chidlovskii and Christian Wolf},
  journal= {arXiv preprint arXiv:2402.13848},
  year   = {2024}
}