中文

通过预测性 Blackwell 可逼近性实现更快博弈求解:关联后悔匹配与镜像下降

计算机科学与博弈论 2021-03-09 v2 人工智能 机器学习 多智能体系统 最优化与控制

摘要

Blackwell 可逼近性是一种用于推理具有向量值收益的重复博弈的框架。我们引入预测性 Blackwell 可逼近性,其中给出下一收益向量的估计值,决策者在估计器准确性的基础上试图取得更好的表现。为了推导实现预测性 Blackwell 可逼近性的算法,我们首先展示了四种知名算法之间的强有力联系。跟随正则化领导者(FTRL)与在线镜像下降(OMD)是在线凸优化中最普遍的后悔最小化器。尽管如此普遍,在求解大规模博弈的实践中(作为反事实后悔最小化框架内的局部后悔最小化器),后悔匹配(RM)与后悔匹配+(RM+)算法更受青睐。我们证明,RM 与 RM+ 分别是在底层 Blackwell 可逼近性博弈中始终运行 FTRL 与 OMD 以选择要强制的半空间所产生的算法。通过将 FTRL 或 OMD 的预测性变体应用于这一联系,我们获得了预测性 Blackwell 可逼近性算法,以及 RM 与 RM+ 的预测性变体。在 18 个常见零和扩展式基准博弈的实验中,我们表明,除两个扑克博弈外,耦合反事实后悔最小化的预测性 RM+ 在所有博弈中均比最快的已有算法(CFR+、DCFR、LCFR)收敛快得多,有时快两个或更多数量级。

关键词

引用

@article{arxiv.2007.14358,
  title  = {Faster Game Solving via Predictive Blackwell Approachability: Connecting Regret Matching and Mirror Descent},
  author = {Gabriele Farina and Christian Kroer and Tuomas Sandholm},
  journal= {arXiv preprint arXiv:2007.14358},
  year   = {2021}
}

备注

Full version. The body of the paper appeared in the proceedings of the AAAI 2021 conference