熵正则化游戏中独立自然策略梯度的线性收敛性
机器学习
2024-05-07 v1 多智能体系统
最优化与控制
摘要
本 work 聚焦于多代理强化学习中的熵正则化独立自然策略梯度(NPG)算法。在本 work 中,假设代理人可获取一个提供精确策略评估的 oracle,并致力于最大化各自独立的奖励。每个 individual 的奖励假设取决于多代理系统中所有代理人的动作,导致代理人之间发生博弈。我们假设所有代理人在基于有限理性的策略下做出决策,通过引入熵正则化来实现这一假设。在实际应用中,较小的正则化意味着代理人更理性,行为更接近纳什政策;而较大的正则化则使代理人更随机,这有助于更好的探索。我们证明,在充分的熵正则化下,该系统的动力学以线性速率收敛到量化响应均衡(QRE)。尽管正则化假设防止 QRE 接近纳什均衡,但我们的发现适用于广泛的游戏,包括合作游戏、潜在游戏和两人矩阵游戏。我们还提供了在多种游戏(包括马尔可夫游戏)上的大量实证结果,以验证我们的理论分析。
引用
@article{arxiv.2405.02769,
title = {Linear Convergence of Independent Natural Policy Gradient in Games with Entropy Regularization},
author = {Youbang Sun and Tao Liu and P. R. Kumar and Shahin Shahrampour},
journal= {arXiv preprint arXiv:2405.02769},
year = {2024}
}