中文

风格化驾驶:通用规划中用于自动驾驶的最大熵逆强化学习

机器人学 2020-09-15 v2 人工智能 机器学习

摘要

行为与运动规划在自动驾驶中起着重要作用。传统上,行为规划器通过预定义行为来指导局部运动规划器。由于城市环境中场景复杂度高,可能出现行为规划器无法匹配预定义行为模板的不可预测情况。近年来,通用规划器被提出,将行为与局部运动规划相结合。这些通用规划器在给定单一奖励函数的情况下允许进行行为感知的运动规划。然而,出现了两个挑战:首先,该函数必须将复杂特征空间映射为奖励;其次,奖励函数必须由专家手动调参。手动调参这一奖励函数成为一项繁琐的任务。本文提出一种基于人类驾驶演示自动调优奖励函数的方法。本研究为利用最大熵逆强化学习优化通用规划器驾驶风格提供了重要见解。我们基于学习策略与演示策略之间的期望值差异评估所提方法。此外,我们比较了在学习和专家调优的奖励函数下,人类驾驶轨迹与本规划器最优策略的相似性。实验表明,无需先验领域知识,我们即可学习到超越手动专家调优水平的奖励函数。

关键词

引用

@article{arxiv.1905.00229,
  title  = {Driving with Style: Inverse Reinforcement Learning in General-Purpose Planning for Automated Driving},
  author = {Sascha Rosbach and Vinit James and Simon Großjohann and Silviu Homoceanu and Stefan Roth},
  journal= {arXiv preprint arXiv:1905.00229},
  year   = {2020}
}

备注

Appeared at IROS 2019. Accepted version. Added/updated footnote, minor correction in preliminaries