中文

随机团队与博弈的去中心化Q学习

最优化与控制 2016-05-03 v2 计算机科学与博弈论 机器学习

摘要

仅有少数学习算法适用于随机动态团队与博弈,后者将马尔可夫决策过程推广到涉及可能自利决策者的去中心化随机控制问题。博弈中的学习通常很困难,因为环境非平稳,每个决策者旨在其他同样在学习的决策者存在下,以最小信息学习其最优决策。在随机动态博弈中,学习更具挑战性,因为学习过程中决策者改变系统状态从而改变未来代价。本文提出用于随机博弈的去中心化Q学习算法,并研究其在弱无环情形下的收敛性,该情形包含团队问题作为重要特例。该算法是去中心化的,因为每个决策者仅能获取其局部信息、状态信息和局部代价实现;此外,它完全无视其他决策者的存在。我们证明这些算法在大量随机博弈类中几乎必然收敛到均衡策略。

关键词

引用

@article{arxiv.1506.07924,
  title  = {Decentralized Q-Learning for Stochastic Teams and Games},
  author = {Gürdal Arslan and Serdar Yüksel},
  journal= {arXiv preprint arXiv:1506.07924},
  year   = {2016}
}

备注

To appear in IEEE Trans. Automatic Control