中文

学习可解释且高性能的自动驾驶策略

机器学习 2023-08-01 v3 机器人学

摘要

强化学习(RL)中基于梯度的方法在学习自动驾驶车辆策略方面取得了巨大成功。尽管这些方法的性能足以支持实际部署,但这些策略缺乏可解释性,限制了其在安全关键且受法律监管的自动驾驶(AD)领域的可部署性。AD需要可解释且可验证的控制策略,同时保持高性能。我们提出可解释连续控制树(ICCTs),一种基于树的模型,可通过现代基于梯度的RL方法进行优化,以产生高性能、可解释的策略。我们方法的关键在于一种允许在稀疏类决策树表示中直接优化的过程。我们在六个领域中将ICCTs与基线进行对比验证,表明ICCTs能够学习可解释的策略表示,在AD场景中达到与基线持平或优于基线高达33%的性能,同时与深度学习基线相比策略参数数量减少300至600倍。此外,我们通过14辆实体机器人演示展示了ICCTs的可解释性与实用性。

关键词

引用

@article{arxiv.2202.02352,
  title  = {Learning Interpretable, High-Performing Policies for Autonomous Driving},
  author = {Rohan Paleja and Yaru Niu and Andrew Silva and Chace Ritchie and Sugju Choi and Matthew Gombolay},
  journal= {arXiv preprint arXiv:2202.02352},
  year   = {2023}
}

备注

Robotics Science and Systems 2022