中文

用于自动驾驶的深度代理 Q 学习

机器学习 2022-02-18 v2 机器人学

摘要

深度强化学习系统应用于真实系统时面临的挑战性问题是其对变化环境的适应性,以及其在计算资源和数据方面的效率。在用于学习自动驾驶变道行为的应用中,智能体必须应对数量变化的周围车辆。此外,所需的转移样本数量构成了瓶颈,因为测试驾驶员无法在现实世界中执行任意次数的变道。在离策略设定下,可通过观察他人的动作获得关于解决任务的额外信息。而在经典 RL 设定中该知识未被利用,我们使用其他驾驶员作为代理,以更高效地学习智能体的值函数。我们提出 Surrogate Q-learning,其处理上述问题并大幅减少所需的驾驶时间。我们进一步提出基于 Q 函数的置换等变深度神经网络架构的高效实现,以估计传感器范围内可变数量车辆的动作价值。我们表明该架构带来了一种称为场景中心经验回放(Scene-centric Experience Replay)的新颖回放采样技术,并在开放交通模拟器 SUMO 中评估了 Surrogate Q-learning 与场景中心经验回放的性能。此外,我们表明我们的方法通过在真实 highD 数据集上学习策略,增强了 RL 系统的现实世界适用性。

关键词

引用

@article{arxiv.2010.11278,
  title  = {Deep Surrogate Q-Learning for Autonomous Driving},
  author = {Maria Kalweit and Gabriel Kalweit and Moritz Werling and Joschka Boedecker},
  journal= {arXiv preprint arXiv:2010.11278},
  year   = {2022}
}

备注

Accepted at ICRA 2022