零和多人博弈中的异步梯度博弈
计算机科学与博弈论
2022-11-17 v1 信息论
机器学习
math.IT
最优化与控制
摘要
近年来,通过梯度博弈在竞争性多智能体博弈中寻找均衡受到越来越多的关注,重点在于设计高效的策略,使智能体以去中心化且对称的方式运行并保证收敛。尽管在理解零和双人矩阵博弈方面已做出大量努力,零和多人博弈中的性能仍未被充分探索,尤其在存在延迟反馈时,使梯度博弈的可扩展性与鲁棒性存疑。在本文中,我们通过研究延迟反馈下零和多项式矩阵博弈中的异步梯度博弈取得进展。我们首先确立,在无延迟时,熵正则化乐观乘性权重更新(OMWU)方法的末次迭代线性收敛到量化响应均衡(QRE)——有限理性下的解概念。虽然在温和统计假设下即使反馈随机延迟时线性收敛仍成立,但由于可接受学习率范围更小,其收敛速率明显更慢。进一步,我们证明熵正则化 OMWU——通过以感知延迟的方式采用双时间尺度学习率——在固定延迟下享有更快的末次迭代收敛,并且即使延迟以平均迭代方式任意有界也能可证明收敛。我们的方法还通过调节正则化量给出了逼近纳什均衡(NE)的有限时间保证。据我们所知,本工作是首个旨在理解广泛延迟假设下零和多项式矩阵博弈中异步梯度博弈的工作,凸显了学习率分离的作用。
引用
@article{arxiv.2211.08980,
title = {Asynchronous Gradient Play in Zero-Sum Multi-agent Games},
author = {Ruicheng Ao and Shicong Cen and Yuejie Chi},
journal= {arXiv preprint arXiv:2211.08980},
year = {2022}
}