中文

RACER:面向快速驾驶的认知风险敏感强化学习

机器人学 2024-05-09 v1 人工智能 机器学习

摘要

强化学习因能够通过纯粹的真实世界交互来学习富有表达力的策略而具有吸引力。然而,这需要解决现实世界的约束问题,并在训练期间避免灾难性故障,这可能会严重阻碍学习进程并影响最终策略的性能。在许多机器人场景中,这等同于避免某些“不安全”状态。高速越野驾驶任务代表了这一问题的极具挑战性的实例:高回报策略应尽可能激进且尽可能快速地驾驶,这通常需要靠近“安全”状态集合的边缘,因此对方法提出了特殊的故障避免要求。为同时实现高性能策略和避免过度故障,我们提出了一种结合风险敏感控制与自适应动作空间课程计划的强化学习框架。此外,我们展示了在配备认知不确定性估计器的风险敏感目标会自动避免超出分布状态。我们在小型越野车上实现了该算法,并表明其能够为真实世界的越野驾驶任务学习高速策略。我们表明该方法在训练过程中显著减少了安全违规次数,并且在具有类似挑战的驾驶与非驾驶仿真环境中均导致更高的性能。

关键词

引用

@article{arxiv.2405.04714,
  title  = {RACER: Epistemic Risk-Sensitive RL Enables Fast Driving with Fewer Crashes},
  author = {Kyle Stachowicz and Sergey Levine},
  journal= {arXiv preprint arXiv:2405.04714},
  year   = {2024}
}

备注

In review, RSS 2024