中文

共识乘性权重更新:利用基于投影算子的博弈签名进行学会学习

计算机科学与博弈论 2022-06-14 v3 机器学习

摘要

Cheung和Piliouras (2020)近期表明,乘性权重更新方法的两个变体——OMWU和MWU——根据博弈是零和还是合作型而呈现相反的收敛性质。受该工作及近期关于单函数优化中学会学习(learning to optimize)文献的启发,我们引入一种用于博弈中纳什均衡末次迭代(last-iterate)收敛学习的新框架,其中沿轨迹的更新规则系数(学习率)由一个以博弈性质为条件的强化学习策略——\textit{博弈签名}——来学习。我们使用一种新的双人博弈分解为八个对应于交换投影算子的分量来构造后者,推广并统一了文献中近期研究的博弈概念。我们比较了各种更新规则在其系数被学习时的性能,并表明RL策略能够跨越广泛博弈类型利用博弈签名。在此过程中,我们引入CMWU,一种将共识优化扩展到约束情形、对零和双矩阵博弈具有局部收敛保证的新算法,并表明其在常系数零和博弈及系数被学习时的一系列博弈上均具有具竞争力的性能。

关键词

引用

@article{arxiv.2106.02615,
  title  = {Consensus Multiplicative Weights Update: Learning to Learn using Projector-based Game Signatures},
  author = {Nelson Vadori and Rahul Savani and Thomas Spooner and Sumitra Ganesh},
  journal= {arXiv preprint arXiv:2106.02615},
  year   = {2022}
}

备注

ICML 2022, the 39th International Conference on Machine Learning