中文

基于高效采样的极大熵逆强化学习及其在自动驾驶中的应用

机器人学 2020-06-25 v1 人工智能 机器学习

摘要

在过去的几十年中,我们见证了自动驾驶领域的显著进展。基于优化和强化学习(RL)的先进技术,在解决正向问题方面变得愈发强大:给定设计的奖励/代价函数,我们应如何优化它们并获得与环境安全高效交互的驾驶策略。这一进展引发了另一个同等重要的问题:我们应当优化什么?相较于手动指定奖励函数,我们希望能够从真实交通数据中提取人类驾驶员试图优化的目标,并将其赋予自动驾驶车辆,从而实现人与智能体之间更自然、透明的交互。针对该问题,本文提出了一种高效的基于采样的极大熵逆强化学习(IRL)算法。与现有 IRL 算法不同,通过引入一种高效的连续域轨迹采样器,所提算法可直接在连续域中学习奖励函数,同时考虑人类驾驶员演示轨迹中的不确定性。我们在真实驾驶数据上评估了所提算法,涵盖非交互与交互场景。实验结果表明,与其他基线 IRL 算法相比,所提算法取得了更精确的预测性能,且具有更快的收敛速度与更好的泛化能力。

关键词

引用

@article{arxiv.2006.13704,
  title  = {Efficient Sampling-Based Maximum Entropy Inverse Reinforcement Learning with Application to Autonomous Driving},
  author = {Zheng Wu and Liting Sun and Wei Zhan and Chenyu Yang and Masayoshi Tomizuka},
  journal= {arXiv preprint arXiv:2006.13704},
  year   = {2020}
}

备注

Accepted by IEEE Robotics and Automation Letters. June 2020