对称团队学习中的局部最优即为全局纳什均衡
计算机科学与博弈论
2022-07-08 v1 人工智能
机器学习
多智能体系统
摘要
尽管自 1970 年代起便已知公共收益博弈中的全局最优策略剖面是纳什均衡,但全局最优这一严格要求限制了该结果的适用性。本文中,我们证明任意局部最优的对称策略剖面也是(全局)纳什均衡。进一步,我们表明该结果对公共收益与局部最优的扰动具有鲁棒性。应用于机器学习,我们的结果为在对称策略空间中找到局部最优的任意梯度方法提供了全局保证。虽然该结果表明对单边偏离具有稳定性,我们仍识别出在联合、非对称偏离下混合局部最优不稳定的广泛博弈类。我们通过在一系列对称博弈中运行学习算法来分析不稳定性的普遍程度,并最后讨论了我们的结果对多智能体强化学习、协作逆强化学习与去中心化 POMDP 的适用性。
引用
@article{arxiv.2207.03470,
title = {For Learning in Symmetric Teams, Local Optima are Global Nash Equilibria},
author = {Scott Emmons and Caspar Oesterheld and Andrew Critch and Vincent Conitzer and Stuart Russell},
journal= {arXiv preprint arXiv:2207.03470},
year = {2022}
}