中文

BEVLM:从大语言模型蒸馏语义知识到鸟瞰视图表示

计算机视觉与模式识别 2026-03-09 v1 人工智能 机器学习 机器人学

摘要

将大语言模型(LLM)集成到自动驾驶领域因其强大的推理和语义理解能力而引起广泛关注,这些能力对于处理复杂决策和长尾场景至关重要。然而,现有方法通常独立地将多视角和多帧图像的标记输入给LLM,导致冗余计算和空间一致性受限。这种视觉处理的分离阻碍了准确的3D空间推理,无法在不同视角之间维持几何一致性。另一方面,鸟瞰视图(BEV)表示通过几何标注任务(如目标检测)学习得来,提供了空间结构,但缺乏基础视觉编码器的语义丰富性。为弥合这一差距,我们提出BEVLM,一种将空间一致且语义蒸馏的BEV表示与LLM连接的框架。通过大量实验,我们展示BEVLM使LLM在跨视图驾驶场景中能够更有效地推理,通过将BEV特征作为统一输入提高了46%的准确率。此外,通过将LLM的语义知识蒸馏到BEV表示中,BEVLM在安全关键场景下显著提高了闭环端到端驾驶性能,提升了29%。

关键词

引用

@article{arxiv.2603.06576,
  title  = {BEVLM: Distilling Semantic Knowledge from LLMs into Bird's-Eye View Representations},
  author = {Thomas Monninger and Shaoyuan Xie and Qi Alfred Chen and Sihao Ding},
  journal= {arXiv preprint arXiv:2603.06576},
  year   = {2026}
}

备注

4 figures, 6 tables in the main paper, 32 pages in total