BEV-LLM:用于自动驾驶场景描述生成的多模态 BEV 地图
计算机视觉与模式识别
2025-07-28 v1
摘要
自动驾驶技术有望变革交通方式,但其广泛采用取决于开发可解释且透明的决策系统。场景描述生成自然语言描述驾驶环境,在提升透明度、安全性和人类-AI 交互方面发挥着关键作用。我们引入 BEV-LLM,一个用于自动驾驶场景三维描述生成的轻量级模型。BEV-LLM 利用 BEVFusion 融合 3D 激光点云和多视角图像, Incorporation of a novel absolute positional encoding for view-specific scene descriptions。尽管使用规模为 1B 参数的基础模型,BEV-LLM 在 nuCaption 数据集上取得竞争性成绩,BLEU 分数提升了最先进技术的可达 5%。此外,我们发布了两个新数据集——nuView(聚焦环境条件和视角)和 GroundView(聚焦物体定位)——以更好地评估跨多样化驾驶情景的场景描述,并弥补当前基准的不足,同时发布初步的基准测试结果,证明其有效性。
引用
@article{arxiv.2507.19370,
title = {BEV-LLM: Leveraging Multimodal BEV Maps for Scene Captioning in Autonomous Driving},
author = {Felix Brandstaetter and Erik Schuetz and Katharina Winter and Fabian Flohr},
journal= {arXiv preprint arXiv:2507.19370},
year = {2025}
}