超越时间平均收敛:通过先知乘性权重更新的近最优非耦合在线学习
计算机科学与博弈论
2022-06-30 v4 人工智能
机器学习
多智能体系统
理论经济学
摘要
在本文中,我们提供一种新颖且简单的算法,先知乘性权重更新(CMWU),用于一般博弈中的后悔最小化。CMWU 有效对应于标准 MWU 算法,但所有智能体在更新其混合策略时使用基于明日行为的收益剖面,即智能体是先知的。CMWU 在所有具有 m 个动作和固定步长 的范式博弈中实现 的常数后悔。尽管 CMWU 在其定义中编码了不动点计算,原则上可能导致既非计算高效也非非耦合的动力学,我们表明这两个问题都可被大幅规避。具体地,只要步长 上界为 ,其中 为智能体数且 为收益范围,则 CMWU 更新可通过压缩映射线性快速计算。该实现产生一种非耦合在线学习动力学,其承认一个 稀疏子序列,其中每个智能体经历至多 后悔。这意味着 CMWU 动力学以 的速率收敛到\textit{粗相关均衡}。后者改进了\textit{非耦合在线学习动力学}的当前最先进收敛速率 \cite{daskalakis2021near,anagnostides2021near}。
引用
@article{arxiv.2111.14737,
title = {Beyond Time-Average Convergence: Near-Optimal Uncoupled Online Learning via Clairvoyant Multiplicative Weights Update},
author = {Georgios Piliouras and Ryann Sim and Stratis Skoulakis},
journal= {arXiv preprint arXiv:2111.14737},
year = {2022}
}
备注
Expanded on the uncoupled online nature of the dynamics