BEV-VLM:基于统一鸟瞰图抽象的轨迹规划
机器人学
2026-03-02 v2 人工智能
摘要
本文提出了 BEV-VLM,一种用于自动驾驶轨迹规划的新方法,该方法利用视觉语言模型(VLM),并以鸟瞰图(BEV)特征图作为视觉输入。与仅依赖原始视觉数据(如相机图像)的传统轨迹规划方法不同,我们的方法利用通过融合相机与激光雷达数据生成的高度压缩且信息丰富的 BEV 表示,随后与高精(HD)地图对齐。这种统一的 BEV-HD 地图格式提供了几何一致且语义丰富的场景描述,使 VLM 能够执行准确且鲁棒的轨迹规划。在 nuScenes 数据集上的实验结果表明,与最先进的纯视觉方法相比,我们的方法在规划精度上提升了 53.1%,并在评估场景中实现了完全的碰撞避免。我们的工作突显了 VLM 能够有效解释诸如 BEV 特征等处理后的视觉表示,从而将其在轨迹规划任务中的适用性扩展到了原始图像输入之外。
关键词
引用
@article{arxiv.2509.25249,
title = {BEV-VLM: Trajectory Planning via Unified BEV Abstraction},
author = {Guancheng Chen and Sheng Yang and Tong Zhan and Jian Wang},
journal= {arXiv preprint arXiv:2509.25249},
year = {2026}
}