中文

在线双重预言

人工智能 2023-02-16 v5 计算机科学与博弈论

摘要

求解具有巨大动作空间的策略博弈是经济学、运筹学与人工智能中关键却未被充分探索的课题。本文提出新的学习算法以求解纯策略数量大得难以处理的二人零和范式博弈。具体而言,我们将在线学习中的无遗憾分析与博弈论中的双重预言(DO)方法相结合。我们的方法——\emph{在线双重预言(ODO)}——可证明收敛至纳什均衡(NE)。最重要的是,不同于普通 DO 方法,ODO 是\emph{理性的},即 ODO 中每个智能体都能以 O(Tklog(k))\mathcal{O}(\sqrt{T k \log(k)}) 的遗憾界利用策略对手,其中 kk 并非纯策略总数,而是与 NE 支撑大小线性相关的\emph{有效策略集}的规模。在数十种不同真实世界博弈中,ODO 在收敛至 NE 的速率与对抗策略对手的平均收益上,均大幅优于 DO、PSRO 方法及如乘性权重更新之类的无遗憾算法。

关键词

引用

@article{arxiv.2103.07780,
  title  = {Online Double Oracle},
  author = {Le Cong Dinh and Yaodong Yang and Stephen McAleer and Zheng Tian and Nicolas Perez Nieves and Oliver Slumbers and David Henry Mguni and Haitham Bou Ammar and Jun Wang},
  journal= {arXiv preprint arXiv:2103.07780},
  year   = {2023}
}

备注

Accepted at Transactions on Machine Learning Research (TMLR)