中文

面向自动驾驶策略学习的基于 VLM 的多智能体协作框架

机器人学 2025-09-23 v1

摘要

基础模型的发展催生了新的自动驾驶策略学习 initiative,以实现安全高效的驾驶。然而,手动工程化奖励函数和复杂动态驾驶任务的训练课程构成了关键瓶颈,这是一种耗时耗力的过程。为此,我们提出 OGR(Orchestrate, Generate, Reflect),一个利用视觉语言模型(VLM)实现的多智能体协作自动驾驶策略学习框架。我们的框架利用 VLM 的先进推理和多模态理解能力构建了分层智能体系统。具体而言,一个集中式 orchestrator 规划高层次训练目标,while 一个生成模块采用分析-生成两步方法高效生成奖励-课程配对。一个反思模块则基于在线评估促进迭代优化。此外,一个专门的记忆模块使 VLM 智能体具备了长期记忆能力。为增强生成过程的鲁棒性和多样性,我们引入了并行生成方案和人类在环技术,用于扩充奖励观测空间。通过高效的多智能体协作和利用丰富的多模态信息,OGR 实现了强化学习策略的在线演化,以获取交互感知的驾驶技能。在 CARLA 模拟器中的大量实验表明,我们的方法在性能、跨不同城市场景的鲁棒通用性以及与各种 RL 算法的强大兼容性方面均表现出色。进一步的实际场景实验凸显了该框架的实用可行性和有效性。该论文接受后,将公开源代码。

关键词

引用

@article{arxiv.2509.17042,
  title  = {Orchestrate, Generate, Reflect: A VLM-Based Multi-Agent Collaboration Framework for Automated Driving Policy Learning},
  author = {Zengqi Peng and Yusen Xie and Yubin Wang and Rui Yang and Qifeng Chen and Jun Ma},
  journal= {arXiv preprint arXiv:2509.17042},
  year   = {2025}
}