中文

使用基于深度策略梯度和值函数的强化学习的交通灯控制

机器学习 2017-05-30 v2

摘要

近期将深度神经网络架构与强化学习技术结合在解决具有高维状态和动作空间的复杂控制问题方面显示出有前景的潜在结果。受这些成功启发,在本文中我们构建了两类强化学习算法:深度策略梯度和基于值函数的智能体,它们可以预测交通路口的最佳可能交通信号。在每个时间步,这些自适应交通灯控制智能体接收图形交通模拟器的当前状态快照并产生控制信号。基于策略梯度的智能体将其观测直接映射到控制信号,而基于值函数的智能体首先估计所有合法控制信号的值。然后智能体选择具有最高值的最优控制动作。我们的方法在SUMO交通模拟器模拟的交通网络中显示出有前景的结果,且在训练过程中未遭受不稳定性问题。

关键词

引用

@article{arxiv.1704.08883,
  title  = {Traffic Light Control Using Deep Policy-Gradient and Value-Function Based Reinforcement Learning},
  author = {Seyed Sajad Mousavi and Michael Schukat and Enda Howley},
  journal= {arXiv preprint arXiv:1704.08883},
  year   = {2017}
}