中文

VLM-MPC:视觉语言基础模型引导的自动驾驶模型预测控制器

机器人学 2024-10-04 v2

摘要

受视觉语言模型(VLMs)涌现推理能力的驱动,以及其提升自动驾驶系统可解释性的潜力,本文提出了一种闭环自动驾驶控制器 VLM-MPC,将模型预测控制器(MPC)与 VLM 相结合,以评估基于模型的控制如何增强 VLM 的决策。提出的 VLM-MPC 由两个异步组件组成:上层 VLM 基于前置摄像头图像、自车状态、交通环境条件和参考记忆生成驾驶参数(如期望速度、期望跟车距离),供下层控制使用;下层 MPC 利用这些参数实时控制车辆,考虑发动机滞后并为整个系统提供状态反馈。基于 nuScenes 数据集的实验验证了所提出的 VLM-MPC 在各种环境(如夜间、雨天和交叉路口)中的有效性。结果表明,VLM-MPC 始终将侵入后时间(PET)保持在安全阈值之上,而 VLM 基础控制在一些场景中存在碰撞风险。此外,VLM-MPC 相比真实轨迹和 VLM 基础控制提升了平滑性。通过比较不同环境设置下的行为,我们突出了 VLM-MPC 理解环境并进行推理推断的能力。此外,我们通过消融实验验证了两个关键组件——参考记忆和环境编码器——对响应稳定性的贡献。

关键词

引用

@article{arxiv.2408.04821,
  title  = {VLM-MPC: Vision Language Foundation Model (VLM)-Guided Model Predictive Controller (MPC) for Autonomous Driving},
  author = {Keke Long and Haotian Shi and Jiaxi Liu and Xiaopeng Li},
  journal= {arXiv preprint arXiv:2408.04821},
  year   = {2024}
}