具有平均收益和完全信息的零和多链随机博弈的策略迭代算法
最优化与控制
2012-08-03 v1 计算机科学与博弈论
摘要
我们考虑具有有限状态和动作空间、完全信息、平均收益准则的零和随机博弈,且不对与策略相关的马尔可夫链做任何不可约性假设(多链博弈)。此类博弈的值可由一个非线性方程组刻画,该方程组涉及平均收益向量和辅助向量(相对值或偏置)。受两位作者(Cochet-Terrasson 和 Gaubert, C. R. Math. Acad. Sci. Paris, 2006)思想的启发,我们开发了一种针对具有平均收益的零和随机博弈的策略迭代算法。该算法依赖于非线性谱投影的概念(Akian 和 Gaubert, Nonlinear Analysis TMA, 2003),这类似于线性势论中超调和函数的约化概念。为避免循环,在每次退化迭代(即平均收益向量未得到改善时),新的相对值是通过约化先前的相对值得到的。我们证明了值序列和相对值序列满足字典序单调性性质,这意味着算法必然终止。我们通过 Richman 博弈(随机拔河或离散无穷拉普拉斯型方程)的平均收益版本说明了该算法,其中退化迭代频繁出现。我们报告了源自此类博弈以及源自平均收益追捕 - 逃避确定性微分博弈的单调离散化的大规模实例的数值实验结果。
引用
@article{arxiv.1208.0446,
title = {Policy iteration algorithm for zero-sum multichain stochastic games with mean payoff and perfect information},
author = {Marianne Akian and Jean Cochet-Terrasson and Sylvie Detournay and Stéphane Gaubert},
journal= {arXiv preprint arXiv:1208.0446},
year = {2012}
}
备注
34pages