中文

通过策略搜索学习协作

人工智能 2014-08-08 v1

摘要

协作博弈是指双方智能体共享相同收益结构的博弈。基于价值的强化学习算法(如 Q-learning 的变体)已被应用于学习协作博弈,但它们仅适用于博弈状态对双方智能体完全可观测的情况。策略搜索方法是处理部分可观测环境的基于价值方法的合理替代方案。在本文中,我们提出了一种用于协作博弈的基于梯度的分布式策略搜索方法,并比较了局部最优与纳什均衡的概念。我们在一个小型、部分可观测的模拟足球领域中通过实验证明了该方法的有效性。

关键词

引用

@article{arxiv.1408.1484,
  title  = {Learning to Cooperate via Policy Search},
  author = {Leonid Peshkin and Kee-Eung Kim and Nicolas Meuleau and Leslie Pack Kaelbling},
  journal= {arXiv preprint arXiv:1408.1484},
  year   = {2014}
}

备注

Appears in Proceedings of the Sixteenth Conference on Uncertainty in Artificial Intelligence (UAI2000)