基于控制理论的博弈在线优化:连接后悔、无源性与庞加莱回归
机器学习
2021-06-16 v2 计算机科学与博弈论
系统与控制
系统与控制
动力系统
摘要
我们通过无源性(passivity)的概念,提出了对博弈中在线优化与学习的全新控制理论理解。无源性是控制理论中的基本概念,它抽象了物理系统中的能量守恒与耗散。它已成为分析一般反馈系统的标准工具,而博弈动态正属于此类系统。我们的出发点是证明所有连续时间跟随正则化领导者(Follow-the-Regularized-Leader, FTRL)动态(包括著名的复制子动态(Replicator Dynamic))都是无损的,即它是无能量耗散的无源系统。有趣的是,我们证明了无源性意味着有界后悔(bounded regret),从而将控制理论与在线优化中的两个基本原语联系起来。在FTRL中观察到能量守恒启发我们提出了一族无损学习动态,其中每一个都具有带简单梯度结构的底层能量函数。该族在凸组合下封闭;作为一个直接推论,任何FTRL动态的凸组合都是无损的,从而具有有界后悔。这使我们能够扩展Fox和Shamma [Games, 2013]的框架,不仅证明博弈动态的全局渐近稳定性结果,也证明庞加莱回归(Poincaré recurrence)结果。直观上,当无损博弈(例如图常数和博弈)与无损学习动态耦合时,它们的反馈互联也是无损的,从而产生类似摆的能量守恒回归行为,推广了Piliouras和Shamma [SODA, 2014]以及Mertikopoulos、Papadimitriou和Piliouras [SODA, 2018]的结果。
引用
@article{arxiv.2106.04748,
title = {Online Optimization in Games via Control Theory: Connecting Regret, Passivity and Poincar\'e Recurrence},
author = {Yun Kuen Cheung and Georgios Piliouras},
journal= {arXiv preprint arXiv:2106.04748},
year = {2021}
}
备注
In ICML 2021