中文

连续动作合作 Markov 博弈中的 SCC-rFMQ 学习

人工智能 2018-09-19 v1

摘要

尽管已提出许多强化学习方法来学习单智能体连续动作域中的最优解,但具有连续动作的多智能体协调域受到的关注相对较少。本文提出一种独立学习器分层方法,称为带递归频率最大 Q 值采样的连续协调(SCC-rFMQ),它将连续动作的合作问题分为两层。第一层通过具有可变探索率的重采样机制从连续动作空间中采样有限动作集,第二层评估采样动作集中的动作并使用强化学习合作方法更新策略。通过在两层构建合作机制,SCC-rFMQ 能有效处理连续动作合作 Markov 博弈中的合作问题。SCC-rFMQ 的有效性在两个精心设计的博弈上得到实验验证,即连续版爬山博弈和合作版小船问题。实验结果表明 SCC-rFMQ 优于其他强化学习算法。

关键词

引用

@article{arxiv.1809.06625,
  title  = {SCC-rFMQ Learning in Cooperative Markov Games with Continuous Actions},
  author = {Chengwei Zhang and Xiaohong Li and Jianye Hao and Siqi Chen and Karl Tuyls and Zhiyong Feng and Wanli Xue and Rong Chen},
  journal= {arXiv preprint arXiv:1809.06625},
  year   = {2018}
}