更快的训练,更少的标签:面向细粒度 BEV 分割的自监督预训练
计算机视觉与模式识别
2026-02-23 v1
摘要
密集的鸟瞰图(BEV)语义地图是自动驾驶的核心,但当前多摄像头方法依赖昂贵且标注不一致的 BEV 地面实况。我们通过两种阶段的训练策略解决这一限制,用于细粒度道路标志分割,在预训练期间移除完整监督,在微调阶段仅需一半的训练数据,同时仍能超过可比较的监督基线模型。在自监督预训练期间,将 BEVFormer 预测结果可微分地重新投影到图像平面,并针对由广泛使用的语义分割模型 Mask2Former 生成的多视角语义伪标签进行训练。一个时间损失鼓励跨帧的一致性。随后的监督微调阶段仅需数据集的一半,并显著缩短训练时间。通过本方法,微调从预训练期间学习的丰富先验知识中受益,提升了性能和 BEV 分割质量(在 nuScenes 上相对于完全监督的基线提升最高 2.5 百分点 mIoU),同时减少数据标注量的一半,并将总训练时间缩短最高可达二分之一。结果表明,可微分重投影加上摄像机视角伪标签可产生可迁移的 BEV 特征,为减少标签的自动驾驶感知提供了可扩展路径。
引用
@article{arxiv.2602.18066,
title = {Faster Training, Fewer Labels: Self-Supervised Pretraining for Fine-Grained BEV Segmentation},
author = {Daniel Busch and Christian Bohn and Thomas Kurbiel and Klaus Friedrichs and Richard Meyes and Tobias Meisen},
journal= {arXiv preprint arXiv:2602.18066},
year = {2026}
}
备注
This Paper has been accepted to the 2026 IEEE Intelligent Vehicles Symposium (IV)