中文

快车道上的规划:在路径积分逆强化学习中利用注意力机制学习交互

机器人学 2021-05-04 v2 人工智能 机器学习

摘要

用于自动驾驶的通用轨迹规划算法利用复杂的奖励函数,对策略、行为和运动学特征进行组合优化。单一奖励函数的设定与调参是一项繁琐的任务,且无法在大量交通场景中泛化。基于路径积分逆强化学习的深度学习方法已成功应用于利用一组采样驾驶策略的特征来预测局部情境相关奖励函数。基于采样的轨迹规划算法能够近似可行驾驶策略的时空子空间,可用于编码情境上下文。然而,与动态物体的交互需要更长的规划时域,这取决于序列上下文建模。在本工作中,我们关注于扩展时域上的序列奖励预测。我们提出了一种神经网络架构,其使用策略注意力机制,通过聚焦于具有类人驾驶风格的轨迹来生成低维上下文向量。此外,我们提出一种时间注意力机制以识别上下文切换并实现对奖励的稳定适应。我们在包含其他运动车辆的复杂仿真驾驶场景中评估了我们的结果。我们的评估表明,我们的策略注意力机制学会聚焦于构型空间中无碰撞的策略。此外,时间注意力机制学会了在扩展规划时域上与其他车辆的持续交互。

关键词

引用

@article{arxiv.2007.05798,
  title  = {Planning on the fast lane: Learning to interact using attention mechanisms in path integral inverse reinforcement learning},
  author = {Sascha Rosbach and Xing Li and Simon Großjohann and Silviu Homoceanu and Stefan Roth},
  journal= {arXiv preprint arXiv:2007.05798},
  year   = {2021}
}

备注

To appear in Proceedings of the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), Las Vegas, NV, USA, October 2020