从视角特权视图学习以自我为中心的BEV表示:用于在线高清地图构建的跨视图监督
计算机视觉与模式识别
2026-05-13 v1
摘要
源自多相机输入的鸟瞰图(BEV)表示已成为在线高清(HD)地图构建的核心接口。然而,大多数方法仅依赖以自我为中心的监督,需要从不完整的观察、遮挡和远距离信息密度递减中推断大规模场景结构,其中透视效应和空间稀疏性阻碍了一致的结构推理。我们引入了跨视图监督(CVS),一种表示学习范式,它将来自自我对齐的俯视视角的几何和拓扑先验迁移到基于相机的BEV编码器中。CVS不是添加辅助语义损失,而是在共享的BEV特征空间中对齐表示,并将来自视角特权教师模型的全局一致结构知识提炼到以自我为中心的骨干网络中。这种监督增强了结构一致性,而无需修改推理架构或在测试时要求俯视输入。在nuScenes上使用来自AID4AD跨视图扩展的自我对齐航空影像进行的实验表明,在保持相同的仅相机推理的同时,相对于StreamMapNet有持续改进。CVS在标准的区域实现了+3.9\,mAP的提升,在扩展的设置中实现了+9.9\,mAP的提升,对应于远距离44\%的相对增益。这些结果突显了视角特权结构监督作为改进HD地图构建中BEV表示学习的有前途的训练原则。
引用
@article{arxiv.2605.12218,
title = {Learning Ego-Centric BEV Representations from a Perspective-Privileged View: Cross-View Supervision for Online HD Map Construction},
author = {Daniel Lengerer and Mathias Pechinger and Klaus Bogenberger and Carsten Markgraf},
journal= {arXiv preprint arXiv:2605.12218},
year = {2026}
}