中文

连续博弈中的自适应学习:最优后悔界与纳什均衡收敛

计算机科学与博弈论 2021-10-19 v2 机器学习 最优化与控制

摘要

在博弈论学习中,多个智能体同时追随各自利益,因此从每个参与者的视角看环境是非平稳的。在此背景下,学习算法的性能常以其后悔值衡量。然而,无后悔算法在博弈论保证方面并非等同:取决于调参方式,其中一些可能驱动系统走向均衡,而另一些可能产生循环、混沌或其他发散轨迹。为此,我们提出一系列基于乐观镜像下降的无后悔策略,具备如下理想性质:i) 不需要任何先验调参或博弈知识;ii) 面对任意对抗性对手均实现 O(\sqrt{T}) 后悔;iii) 对收敛型对手收敛至最佳响应。此外,若所有玩家均采用,则 iv) 保证 O(1) 社会后悔;且 v) 所诱导的博弈序列在所有变分稳定博弈(一类包含所有单调与凸凹零和博弈的博弈)中以 O(1) 个体后悔收敛至纳什均衡。

关键词

引用

@article{arxiv.2104.12761,
  title  = {Adaptive Learning in Continuous Games: Optimal Regret Bounds and Convergence to Nash Equilibrium},
  author = {Yu-Guan Hsieh and Kimon Antonakopoulos and Panayotis Mertikopoulos},
  journal= {arXiv preprint arXiv:2104.12761},
  year   = {2021}
}

备注

In the 34th Annual Conference on Learning Theory (COLT 2021); 35 pages, 2 figures