正则化学习下博弈中动态稳定性与策略稳定性的等价性
计算机科学与博弈论
2023-11-07 v1 机器学习
最优化与控制
摘要
本文研究了有限博弈中正则化无遗憾学习的长期行为。该领域一个著名结论指出,无遗憾博弈的经验频率收敛至博弈的粗相关均衡集;然而,我们对参与者实际策略随时间演化的理解则有限得多——且在许多情形下完全缺失。近期一系列结果表明,在正则化学习下仅有严格纳什均衡是稳定且吸引的,这进一步加剧了该问题,使得学习与逐点解概念之间的关系尤为难以捉摸。有鉴于此,我们采取更一般的视角,转而刻画参与者日常博弈的集合理性性质。为此,我们聚焦于最严格的集合wise策略稳定性准则之一,即对任意单方面偏离该集合的行为均使偏离者付出代价——这一性质称为在更优回复下封闭(club)。由此,我们获得了策略稳定性与动态稳定性之间深远的等价性:一个纯策略乘积在更优回复下封闭,当且仅当其在正则化学习下生成的张成空间是稳定且吸引的。此外,我们估计了到此类集合的收敛速率,并表明基于熵正则化的方法(如指数权重算法)以几何速率收敛,而基于投影的方法即使在 bandit、基于收益的反馈下也能在有限次迭代内收敛。
引用
@article{arxiv.2311.02407,
title = {The equivalence of dynamic and strategic stability under regularized learning in games},
author = {Victor Boone and Panayotis Mertikopoulos},
journal= {arXiv preprint arXiv:2311.02407},
year = {2023}
}
备注
31 pages, 8 figures, 2 tables