中文

GOLD-BEV:面向动态场景密集语义 BEV 建图的地面与空中数据

计算机视觉与模式识别 2026-04-22 v1 人工智能

摘要

在几何一致且以场景为中心的表示中理解道路场景对于规划与建图至关重要。我们提出了 GOLD-BEV,这是一个从自车中心传感器学习密集鸟瞰图(BEV)语义环境地图——包括动态智能体——的框架,仅在训练期间使用时间同步的航空影像作为监督。BEV 对齐的空中裁剪图像提供了直观的目标空间,能够以最少的人工工作进行密集语义标注,并避免了仅依赖自车 BEV 标注的歧义。关键在于,严格的空地同步允许俯视观测监督移动的交通参与者,并减轻非同步俯视数据源固有的时间不一致性。为了获得可扩展的密集目标,我们使用领域自适应的空中教师模型生成 BEV 伪标签,并将 BEV 分割与可选的伪空中 BEV 重建联合训练以增强可解释性。最后,我们通过学习从自车传感器合成伪空中 BEV 图像,超越了空中覆盖范围的限制,这些图像支持轻量级人工标注和针对未标注驾驶数据的感知不确定性的伪标注。

关键词

引用

@article{arxiv.2604.19411,
  title  = {GOLD-BEV: GrOund and aeriaL Data for Dense Semantic BEV Mapping of Dynamic Scenes},
  author = {Joshua Niemeijer and Alaa Eddine Ben Zekri and Reza Bahmanyar and Philipp M. Schmälzle and Houda Chaabouni-Chouayakh and Franz Kurz},
  journal= {arXiv preprint arXiv:2604.19411},
  year   = {2026}
}