中文

同时行动博弈中蒙特卡洛树搜索的 Hannan 一致选择的析取

计算机科学与博弈论 2019-07-09 v3

摘要

Hannan 一致性(或无外部后悔)是博弈中学习的关键概念。若动作选择算法是 Hannan 一致的(HC),则其表现最终不劣于事后选择最佳固定动作。若零和正态形博弈中双方均使用 Hannan 一致算法,其平均行为收敛到博弈的纳什均衡(NE)。关于扩展形博弈有类似结果,但所执行的策略需相对于反事实值满足 Hannan 一致性,而反事实值通常难以获得。我们研究具有同时行动但其余为完美信息的零和扩展形博弈。这些博弈推广了正态形博弈,且是扩展形博弈的特例。我们研究是否在这些博弈的每个决策点直接对观测收益应用 HC 算法会导致收敛到纳什均衡。该学习过程对应于一类蒙特卡洛树搜索算法,该类算法在博弈同时行动游戏中流行,但无任何已知性能保证。我们表明,直接在观测收益上使用 HC 算法不足以保证收敛。辅以对联合动作的额外平均,可保证收敛,但经验上更慢。我们进一步定义了 HC 算法的一个额外性质,其足以在保证无需平均的情况下实现收敛,并经验地表明常用的 HC 算法具有该性质。

关键词

引用

@article{arxiv.1804.09045,
  title  = {Analysis of Hannan Consistent Selection for Monte Carlo Tree Search in Simultaneous Move Games},
  author = {Vojtěch Kovařík and Viliam Lisý},
  journal= {arXiv preprint arXiv:1804.09045},
  year   = {2019}
}

备注

arXiv admin note: substantial text overlap with arXiv:1509.00149