中文

通过离线强化学习从观测中学习控制自动驾驶车队

系统与控制 2023-08-28 v2 机器学习 机器人学 系统与控制

摘要

自动驾驶按需出行(AMoD)系统是一种不断演进的交通模式,其中集中协调的自动驾驶车辆车队动态响应出行请求。这些系统的控制通常被表述为一个大规模网络优化问题,而强化学习(RL)最近已成为解决该领域开放挑战的一种有前景的方法。近期的集中式RL方法侧重于从在线数据中学习,忽视了真实世界交通系统内交互的每样本代价。为应对这些局限,我们提出通过离线强化学习的视角形式化AMoD系统的控制,并仅使用离线数据(当前出行运营商 readily available)学习有效控制策略。我们进一步研究设计决策,并基于真实世界出行系统的数据提供经验证据,表明离线学习如何恢复AMoD控制策略,其(i)表现出与在线方法相当的性能,(ii)允许样本高效的在线微调,以及(iii)消除对复杂仿真环境的需求。关键在于,本文证明了离线RL对于在经济关键系统(如出行系统)中应用基于RL的解决方案是一种有前景的范式。

关键词

引用

@article{arxiv.2302.14833,
  title  = {Learning to Control Autonomous Fleets from Observation via Offline Reinforcement Learning},
  author = {Carolin Schmidt and Daniele Gammelli and Francisco Camara Pereira and Filipe Rodrigues},
  journal= {arXiv preprint arXiv:2302.14833},
  year   = {2023}
}