VLM-UDMC:面向城市自动驾驶的 VLM 增强统一决策与运动控制
机器人学
2025-07-22 v1 系统与控制
系统与控制
摘要
场景理解和风险感知注意力是人类驾驶员作出安全有效决策的关键因素。为在城市自动驾驶中模拟这种认知能力,同时确保透明度和可解释性,我们提出一种基于视觉语言模型(VLM)的统一决策与运动控制框架,称为VLM-UDMC。该框架将场景推理和风险感知洞察纳入上位慢系统中,动态重构下位快速系统的optimal运动规划。这种重构基于实时环境变化,这些变化通过基于上下文的势函数编码。更具体地,上位慢系统采用检索增强生成(RAG)的两步推理策略,利用基础模型处理多模态输入并检索上下文知识,从而生成风险感知洞察。与此同时,一个轻量级多核分解LSTM为异构交通参与者提供实时轨迹预测,通过提取更平滑的短期轨迹表示。通过仿真和实际道路实验验证了所提出VLM-UDMC框架的有效性。结果表明,所提出的VLM-UDMC有效利用场景理解和注意力分解进行理性驾驶决策,从而提高了整体城市驾驶性能。我们的开源项目已公开于 https://github.com/henryhcliu/vlmudmc.git。
引用
@article{arxiv.2507.15266,
title = {VLM-UDMC: VLM-Enhanced Unified Decision-Making and Motion Control for Urban Autonomous Driving},
author = {Haichao Liu and Haoren Guo and Pei Liu and Benshan Ma and Yuxiang Zhang and Jun Ma and Tong Heng Lee},
journal= {arXiv preprint arXiv:2507.15266},
year = {2025}
}
备注
14 pages, 12 figures