中文

具有平均收益和完全信息的零和多链随机博弈的策略迭代算法

最优化与控制 2012-08-03 v1 计算机科学与博弈论

摘要

我们考虑具有有限状态和动作空间、完全信息、平均收益准则的零和随机博弈,且不对与策略相关的马尔可夫链做任何不可约性假设(多链博弈)。此类博弈的值可由一个非线性方程组刻画,该方程组涉及平均收益向量和辅助向量(相对值或偏置)。受两位作者(Cochet-Terrasson 和 Gaubert, C. R. Math. Acad. Sci. Paris, 2006)思想的启发,我们开发了一种针对具有平均收益的零和随机博弈的策略迭代算法。该算法依赖于非线性谱投影的概念(Akian 和 Gaubert, Nonlinear Analysis TMA, 2003),这类似于线性势论中超调和函数的约化概念。为避免循环,在每次退化迭代(即平均收益向量未得到改善时),新的相对值是通过约化先前的相对值得到的。我们证明了值序列和相对值序列满足字典序单调性性质,这意味着算法必然终止。我们通过 Richman 博弈(随机拔河或离散无穷拉普拉斯型方程)的平均收益版本说明了该算法,其中退化迭代频繁出现。我们报告了源自此类博弈以及源自平均收益追捕 - 逃避确定性微分博弈的单调离散化的大规模实例的数值实验结果。

关键词

引用

@article{arxiv.1208.0446,
  title  = {Policy iteration algorithm for zero-sum multichain stochastic games with mean payoff and perfect information},
  author = {Marianne Akian and Jean Cochet-Terrasson and Sylvie Detournay and Stéphane Gaubert},
  journal= {arXiv preprint arXiv:1208.0446},
  year   = {2012}
}

备注

34pages