分布式异步策略迭代用于序贯零和博弈与极小极大控制
计算机科学与博弈论
2021-10-22 v4 系统与控制
系统与控制
最优化与控制
摘要
我们引入了一种收缩抽象动态规划框架及相关的策略迭代算法,专为具有一般结构的序贯零和博弈和极小极大问题设计。除更强的通用性外,我们的算法相对于替代方案的优势在于解决了自Pollatschek和Avi-Itzhak方法[PoA69]用于有限状态马尔可夫博弈以来已知的“自然”策略迭代算法的一些长期收敛困难。从数学上讲,这种“自然”算法是求解贝尔曼方程的牛顿法的一种形式,但不同于单智能体DP问题情形,牛顿法在极小极大问题中并非全局收敛,因为贝尔曼算子可能具有既非凸也非凹的分量。我们的算法通过引入交替玩家选择,并使用具有一致 sup-范数收缩性质的策略相关映射来解决此困难,类似于Bertsekas和Yu[BeY10]、[BeY12]、[YuB13]的早期工作。此外,我们的算法允许基于状态空间划分,以及在每个划分集内分布式异步策略评估和策略改进操作的收敛且高度可并行化实现。我们的框架也适用于基于聚合的强化学习方法的使用,这可能有助于大规模问题实例。
引用
@article{arxiv.2107.10406,
title = {Distributed Asynchronous Policy Iteration for Sequential Zero-Sum Games and Minimax Control},
author = {Dimitri Bertsekas},
journal= {arXiv preprint arXiv:2107.10406},
year = {2021}
}