V-Max:自动驾驶的强化学习框架
机器学习
2025-07-18 v3 人工智能
机器人学
摘要
基于学习的决策制定有望实现可泛化的自动驾驶(AD)策略,减少基于规则方法的工程开销。模仿学习(IL)仍是主导范式,受益于大规模人类演示数据集,但存在分布偏移和模仿差距等固有局限。强化学习(RL)呈现了有前景的替代方案,然而其在AD中的应用仍受限于缺乏标准化且高效的研究框架。为此,我们提出了V-Max,一个开放研究框架,提供使RL适用于AD所需的所有工具。V-Max基于Waymax构建,这是一个面向大规模实验设计的硬件加速AD模拟器。我们使用ScenarioNet的方法对其进行扩展,使其能够快速模拟多样化的AD数据集。
引用
@article{arxiv.2503.08388,
title = {V-Max: A Reinforcement Learning Framework for Autonomous Driving},
author = {Valentin Charraut and Waël Doulazmi and Thomas Tournaire and Thibault Buhet},
journal= {arXiv preprint arXiv:2503.08388},
year = {2025}
}
备注
RLC 25 - Camera-ready