策略迭代的格论视角
计算机科学中的逻辑
2022-12-14 v2
摘要
策略迭代是一种常用于双人博弈以确定赢家或计算收益的技术,但据我们所知,尚未有针对策略迭代的一般性框架被提出。受先前关于简单随机博弈工作的启发,我们基于 MV-链,提出了一种在合适完备格类上求解最小不动点方程的策略迭代通用形式化方法。我们设计了可用于表示为所谓 min-分解与 max-分解的非扩张不动点函数的算法。相应地,我们发展了两种不同的技术:自上方策略迭代,其需解决迭代可能到达非最小不动点的问题;以及自下方策略迭代,其在算法上更简单,但需要更复杂的正确性论证。我们将该方法应用于求解能量博弈并计算概率自动机的行为度量。
引用
@article{arxiv.2207.09872,
title = {A Lattice-Theoretical View of Strategy Iteration},
author = {Paolo Baldan and Richard Eggert and Barbara König and Tommaso Padoan},
journal= {arXiv preprint arXiv:2207.09872},
year = {2022}
}