基于 Cross-View Transformer 的自主车辆鸟瞰图生成初始研究
计算机视觉与模式识别
2025-08-19 v1 人工智能
摘要
鸟瞰图(BEV)提供了一种结构化的自上而下的抽象,对自主驾驶感知至关重要。本文我们采用 Cross-View Transformer(CVT)用于学习将相机图像映射到三个 BEV 通道——道路、车道标线和计划轨迹,使用用于城市驾驶的真实模拟器。我们的研究考察了对未知城镇的泛化能力、不同的相机布局以及两种损失函数(focal 和 L1)。使用来自单一城镇的训练数据,采用 L1 损失训练的四摄像头 CVT 在新城镇中 delivers 最robust 的 test 性能。总体而言,我们的结果凸显了 CVT 将相机输入映射到相对准确 BEV 图的前景。
引用
@article{arxiv.2508.12520,
title = {An Initial Study of Bird's-Eye View Generation for Autonomous Vehicles using Cross-View Transformers},
author = {Felipe Carlos dos Santos and Eric Aislan Antonelo and Gustavo Claudio Karl Couto},
journal= {arXiv preprint arXiv:2508.12520},
year = {2025}
}
备注
12 pages,submitted in ENIAC 2025