中文

最严格者生存:正则化学习与部分信息下的稳定与不稳定均衡

计算机科学与博弈论 2021-02-05 v2 机器学习 多智能体系统 最优化与控制

摘要

在本文中,我们考察了一般 N 人博弈中无遗憾学习(no-regret learning)的纳什均衡收敛性质。为具体起见,我们聚焦于典型的跟随正则化领导者(follow the regularized leader, FTRL)算法族,并考虑参与者可能遇到的完整不确定性谱系——从带噪声的、基于预言机的反馈,到强盗式、基于收益的反馈。在这一一般背景下,我们建立了纳什均衡的稳定性与其支撑(support)之间的全面等价关系:一个纳什均衡是稳定的且以任意高概率吸引的,当且仅当它是严格(strict)的(即每个均衡策略都有唯一最优响应)。该等价关系将演化博弈论民间定理(folk theorem)现有的连续时间版本推广到一个名副其实的算法学习设定,并为预测博弈中无遗憾学习的日常行为提供了一个清晰的精炼准则。

关键词

引用

@article{arxiv.2101.04667,
  title  = {Survival of the strictest: Stable and unstable equilibria under regularized learning with partial information},
  author = {Angeliki Giannou and Emmanouil-Vasileios Vlatakis-Gkaragkounis and Panayotis Mertikopoulos},
  journal= {arXiv preprint arXiv:2101.04667},
  year   = {2021}
}