基于 Kullback-Leibler 散度正则化在群体博弈中处理延迟收益的学习
系统与控制
2024-12-31 v3 系统与控制
摘要
我们研究大群体博弈中的多智能体决策问题。来自多个群体的智能体选择策略以相互进行重复交互。在这些交互的每一阶段,智能体利用其决策模型,基于底层博弈确定的收益来修正其策略选择。其目标是学习对应于博弈纳什均衡的策略。然而,当博弈存在时间延迟时,群体博弈文献中的常规决策模型可能导致策略修正过程出现振荡,或收敛到纳什均衡以外的均衡。为解决该问题,我们提出 Kullback-Leibler 散度正则化学习(KLD-RL)模型,以及一种在通信智能体网络上迭代更新模型正则化参数的算法。利用基于无源性的收敛分析技术,我们证明即便对于一类受时间延迟影响的群体博弈,KLD-RL 模型也能无振荡地收敛至纳什均衡。我们在双人 congestion game 与双人零和博弈上以数值方式验证了主要结果。
引用
@article{arxiv.2306.07535,
title = {Learning with Delayed Payoffs in Population Games using Kullback-Leibler Divergence Regularization},
author = {Shinkyu Park and Naomi Ehrich Leonard},
journal= {arXiv preprint arXiv:2306.07535},
year = {2024}
}