中文

VLM-E2E:基于多模态驾驶员注意力融合增强端到端自动驾驶

计算机视觉与模式识别 2025-09-19 v2 人工智能

摘要

人类驾驶员通过利用丰富的注意力语义在复杂场景中高效导航,但当前的自动驾驶系统往往难以复制这一能力,因为在将 2D 观察转换为 3D 空间时往往丢失关键语义信息。这限制了其在动态复杂环境中的有效部署。利用视觉语言模型 (VLM) 的优越场景理解与推理能力,我们提出 VLM-E2E,一种新型框架,通过提供注意力线索来增强训练。我们的方法将文本表示整合到鸡瞰视图 (BEV) 特征中进行语义监督,从而使模型能够学习更丰富的特征表示,显式地捕捉驾驶员注意力语义。通过关注注意力语义,VLM-E2E 更贴近人类驾驶行为,这对于在动态复杂环境中导航至关重要。此外,我们引入 BEV-文本可学习加权融合策略,以解决多模态信息融合中的模态重要性不平衡问题。该方法动态平衡了 BEV 和文本特征的贡献,确保视觉和文本模态的互补信息得到有效利用。通过显式解决多模态融合中的不平衡问题,我们的方法促进了对驾驶环境更全面和稳健的表示。我们在 nuScenes 数据集上评估了 VLM-E2E,在感知、预测和规划任务上均显著优于基准端到端模型,展示了该注意力增强 BEV 表示在实现更准确和可靠的自动驾驶任务方面的有效性。

关键词

引用

@article{arxiv.2502.18042,
  title  = {VLM-E2E: Enhancing End-to-End Autonomous Driving with Multimodal Driver Attention Fusion},
  author = {Pei Liu and Haipeng Liu and Haichao Liu and Xin Liu and Jinxin Ni and Jun Ma},
  journal= {arXiv preprint arXiv:2502.18042},
  year   = {2025}
}