零和马尔可夫博弈中策略优化的更快末次迭代收敛
计算机科学与博弈论
2022-10-05 v2 人工智能
机器学习
最优化与控制
摘要
多智能体强化学习(MARL)——多个智能体在共享动态环境中学习交互——广泛应用于一系列关键应用。尽管在理解单智能体 RL 中策略优化方法的全局收敛方面已取得实质性进展,但 MARL 设定下高效策略优化算法的设计与分析仍存在重大挑战,遗憾的是,现有理论对此仍严重关注不足。本文关注竞争型多智能体 RL 的最基本设定,即二人零和马尔可夫博弈,并研究无限 horizon 折扣设定与有限 horizon 片段设定下的均衡寻找算法。我们提出一种单循环策略优化方法,由双方智能体对称更新,其中策略通过熵正则化乐观乘性权重更新(OMWU)方法更新,价值以更慢的时间尺度更新。我们证明,在完全信息表格设定下,所提方法对正则化问题的量化响应均衡实现有限时间末次迭代线性收敛,通过控制正则化量可转化为对纳什均衡的亚线性末次迭代收敛。我们的收敛结果改进了已知最佳迭代复杂度,并增进了对竞争型马尔可夫博弈中策略优化的理解。
引用
@article{arxiv.2210.01050,
title = {Faster Last-iterate Convergence of Policy Optimization in Zero-Sum Markov Games},
author = {Shicong Cen and Yuejie Chi and Simon S. Du and Lin Xiao},
journal= {arXiv preprint arXiv:2210.01050},
year = {2022}
}