中文

一般和随机博弈的梯度下降方案研究

机器学习 2015-07-02 v1 计算机科学与博弈论

摘要

零和随机博弈易于求解,因为它们可被转化为简单的马尔可夫决策过程。然而一般和随机博弈并非如此。Filar和Vrieze [2004]给出了一个相当通用的一般和随机博弈优化问题公式。但该优化问题具有非线性目标函数和带有特殊结构的非线性约束。由于该优化问题的目标与约束的梯度均有良好定义,基于梯度的方案似乎是自然的选择。我们讨论了一种针对双人随机博弈调整的梯度方案。我们在仿真中表明,对于一个建模为一般和随机博弈的简单地形探索问题,该方案确实收敛到纳什均衡。然而,结果表明只有该优化问题的全局极小对应于底层一般和随机博弈的纳什均衡,而梯度方案仅保证收敛到局部极小。我们随后给出了在一般和随机博弈中梯度方案收敛到纳什均衡的重要必要条件。

关键词

引用

@article{arxiv.1507.00093,
  title  = {A Study of Gradient Descent Schemes for General-Sum Stochastic Games},
  author = {H. L. Prasad and Shalabh Bhatnagar},
  journal= {arXiv preprint arXiv:1507.00093},
  year   = {2015}
}