中文

弱合作多智能体交通控制问题的独立强化学习

机器学习 2021-04-23 v1

摘要

自适应交通信号控制(ATSC)问题可建模为城市路口间的多智能体合作博弈,其中路口合作为优化其共同目标。近来,强化学习(RL)在管理序贯决策问题中取得显著成功,这促使我们将 RL 应用于 ASTC 问题。此处我们使用独立强化学习(IRL)来解决本研究中的复杂交通合作控制问题。该问题的最大挑战之一是路口的观测信息通常为部分可观测,这限制了 IRL 算法的学习性能。为此,我们将交通控制问题建模为部分可观测弱合作交通模型(PO-WCTM)以优化一组路口的整体交通状况。不同于传统 IRL 任务在全合作博弈中对所有智能体回报取平均,PO-WCTM 中每个路口的学习目标是降低学习的合作难度,这也与交通环境假设一致。我们还提出一种称为合作宽容双重 DQN(CIL-DDQN)的 IRL 算法,其使用两种机制扩展了双重 DQN(DDQN)算法:遗忘经验机制与宽容权重训练机制。前一机制降低经验回放缓冲中存储经验的重要性,以处理由其他智能体策略变化引起的经验失效问题。后一机制增加高估计经验的权重并“宽容地”训练 DDQN 神经网络,从而提高合作联合策略被选中的概率。实验结果表明,CIL-DDQN 在交通控制问题的几乎所有性能指标上均优于其他方法。

关键词

引用

@article{arxiv.2104.10917,
  title  = {Independent Reinforcement Learning for Weakly Cooperative Multiagent Traffic Control Problem},
  author = {Chengwei Zhang and Shan Jin and Wanli Xue and Xiaofei Xie and Shengyong Chen and Rong Chen},
  journal= {arXiv preprint arXiv:2104.10917},
  year   = {2021}
}