驾驶风格编码器:面向自动驾驶通用规划的情境奖励自适应
机器人学
2020-09-17 v2 人工智能
机器学习
摘要
自动驾驶的通用规划算法将任务、行为与局部运动规划相结合。此类规划算法将环境特征与驾驶运动学映射为复杂的奖励函数。为此,规划专家通常依赖线性奖励函数。这些奖励函数的制定与调参过程繁琐,且需要大量经验。此外,人工设计的线性奖励函数无法在不同驾驶情境间泛化。本工作中,我们提出一种基于逆强化学习的深度学习方法,可生成依赖于情境的奖励函数。我们的神经网络在基于模型预测控制(model-predictive control)的规划器的采样驾驶策略的特征与动作之间提供映射,并预测后续规划周期的奖励函数。在评估中,我们将深度网络预测的奖励函数的驾驶风格与聚类线性奖励函数及线性奖励函数进行比较。我们提出的深度学习方法优于聚类线性奖励函数,并与具备情境先验知识的线性奖励函数表现相当。
引用
@article{arxiv.1912.03509,
title = {Driving Style Encoder: Situational Reward Adaptation for General-Purpose Planning in Automated Driving},
author = {Sascha Rosbach and Vinit James and Simon Großjohann and Silviu Homoceanu and Xing Li and Stefan Roth},
journal= {arXiv preprint arXiv:1912.03509},
year = {2020}
}
备注
To appear in Proceedings of the IEEE International Conference on Robotics and Automation (ICRA), Paris, France, June 2020 (Virtual Conference). Accepted version. Corrected figure font