中文

COVLM-RL:基于 VLM 指导的自主驾驶关键目标导向推理强化学习

机器人学 2025-12-11 v1

摘要

端到端自主驾驶框架面临着泛化性、训练效率和可解释性持续面临的挑战。虽然近期方法通过在大规模数据集上利用视觉语言模型(VLM)进行监督式学习来提升推理能力,但往往在新情境下缺乏鲁性。相反,基于强化学习(RL)的方法虽能提升适应性,但数据效率低且缺乏透明的决策过程。为此,我们提出 COVLM-RL,一种新型端到端驾驶框架,将关键目标导向(CO)推理与 VLM 指导下的 RL 集成。具体而言,我们设计了链式思维(CoT)提示策略,使 VLM 能对关键交通要素进行推理并生成高层次语义决策,从而将多视角视觉输入有效转化为结构化语义决策先验。这些先验减少了输入维度,注入任务相关知识至 RL 循环,加速训练并提升策略可解释性。然而,在高层次语义指导与连续低层控制之间仍存在难题。为此,我们引入一致性损失,鼓励 VLM 的语义计划与 RL 智能体的控制输出保持一致,从而增强可解释性和训练稳定性。在 CARLA 模拟器中的实验表明,COVLM-RL 在训练驾驶环境中成功率提升 30%,在未见环境中提升 50%,凸显其强大的泛化能力。

关键词

引用

@article{arxiv.2512.09349,
  title  = {COVLM-RL: Critical Object-Oriented Reasoning for Autonomous Driving Using VLM-Guided Reinforcement Learning},
  author = {Lin Li and Yuxin Cai and Jianwu Fang and Jianru Xue and Chen Lv},
  journal= {arXiv preprint arXiv:2512.09349},
  year   = {2025}
}

备注

8 pages, 5 figures