中文

V-Max:自动驾驶的强化学习框架

机器学习 2025-07-18 v3 人工智能 机器人学

摘要

基于学习的决策制定有望实现可泛化的自动驾驶(AD)策略,减少基于规则方法的工程开销。模仿学习(IL)仍是主导范式,受益于大规模人类演示数据集,但存在分布偏移和模仿差距等固有局限。强化学习(RL)呈现了有前景的替代方案,然而其在AD中的应用仍受限于缺乏标准化且高效的研究框架。为此,我们提出了V-Max,一个开放研究框架,提供使RL适用于AD所需的所有工具。V-Max基于Waymax构建,这是一个面向大规模实验设计的硬件加速AD模拟器。我们使用ScenarioNet的方法对其进行扩展,使其能够快速模拟多样化的AD数据集。

关键词

引用

@article{arxiv.2503.08388,
  title  = {V-Max: A Reinforcement Learning Framework for Autonomous Driving},
  author = {Valentin Charraut and Waël Doulazmi and Thomas Tournaire and Thibault Buhet},
  journal= {arXiv preprint arXiv:2503.08388},
  year   = {2025}
}

备注

RLC 25 - Camera-ready