VLM-MPC:视觉语言基础模型引导的自动驾驶模型预测控制器
机器人学
2024-10-04 v2
摘要
受视觉语言模型(VLMs)涌现推理能力的驱动,以及其提升自动驾驶系统可解释性的潜力,本文提出了一种闭环自动驾驶控制器 VLM-MPC,将模型预测控制器(MPC)与 VLM 相结合,以评估基于模型的控制如何增强 VLM 的决策。提出的 VLM-MPC 由两个异步组件组成:上层 VLM 基于前置摄像头图像、自车状态、交通环境条件和参考记忆生成驾驶参数(如期望速度、期望跟车距离),供下层控制使用;下层 MPC 利用这些参数实时控制车辆,考虑发动机滞后并为整个系统提供状态反馈。基于 nuScenes 数据集的实验验证了所提出的 VLM-MPC 在各种环境(如夜间、雨天和交叉路口)中的有效性。结果表明,VLM-MPC 始终将侵入后时间(PET)保持在安全阈值之上,而 VLM 基础控制在一些场景中存在碰撞风险。此外,VLM-MPC 相比真实轨迹和 VLM 基础控制提升了平滑性。通过比较不同环境设置下的行为,我们突出了 VLM-MPC 理解环境并进行推理推断的能力。此外,我们通过消融实验验证了两个关键组件——参考记忆和环境编码器——对响应稳定性的贡献。
引用
@article{arxiv.2408.04821,
title = {VLM-MPC: Vision Language Foundation Model (VLM)-Guided Model Predictive Controller (MPC) for Autonomous Driving},
author = {Keke Long and Haotian Shi and Jiaxi Liu and Xiaopeng Li},
journal= {arXiv preprint arXiv:2408.04821},
year = {2024}
}