面向0/1多面体博弈的核化乘法权重算法:弥合扩展式与标准式博弈学习间的鸿沟
计算机科学与博弈论
2022-02-02 v1 机器学习
摘要
尽管扩展式博弈(EFG)可转化为标准式博弈(NFG),但此举代价是策略空间呈指数级膨胀。因此,NFG与EFG的研究历来各行其道,EFG领域往往需追赶更大的NFG领域所取得的进展(例如末次迭代收敛与预测遗憾界)。本文表明,NFG的主流学习算法——乐观乘法权重更新(OMWU)算法——可利用核技巧,在EFG的等价标准式上以每轮与博弈树规模成线性时间的方式被模拟。所得算法核化OMWU(KOMWU)可更广泛地应用于所有策略空间为具有0/1整数顶点的多面体的凸博弈,只要核可被高效计算。在EFG这一特例中,KOMWU通过将迄今仅在NFG中可实现的优良学习动态性质直接、黑箱式地迁移至EFG,弥合了NFG与EFG学习间若干长期存在的鸿沟。具体而言,KOMWU给出了首个同时保证末次迭代收敛、对博弈树规模的依赖低于所有先前算法、且在所有玩家采用时具有遗憾的算法。
引用
@article{arxiv.2202.00237,
title = {Kernelized Multiplicative Weights for 0/1-Polyhedral Games: Bridging the Gap Between Learning in Extensive-Form and Normal-Form Games},
author = {Gabriele Farina and Chung-Wei Lee and Haipeng Luo and Christian Kroer},
journal= {arXiv preprint arXiv:2202.00237},
year = {2022}
}