中文

重复随机博弈中的非短视学习

计算机科学与博弈论 2018-01-22 v3 人工智能 机器学习

摘要

在重复随机博弈(RSGs)中,智能体必须快速适应先前未知的伙伴的行为,而这些伙伴本身可能也在学习。由于存在多个(甚至是无限个)均衡以及 inherently 巨大的策略空间,这一机器学习问题尤为具有挑战性。在本文中,我们提出了一种方法,将双人一般和重复随机博弈的策略空间缩减为少数几个专家策略。这一称为 Mega 的过程,有效地将重复随机博弈简化为一个多臂老虎机问题。我们表明,所得的策略空间保留了原始重复随机博弈的几个重要性质,从而使学习者能够在相对较少的交互次数内生成鲁棒的策略。为了更好地确立该方法的优势与劣势,我们在三种不同的重复随机博弈中,将所得的学习系统与其他算法进行了实证评估。

关键词

引用

@article{arxiv.1409.8498,
  title  = {Non-myopic learning in repeated stochastic games},
  author = {Jacob W. Crandall},
  journal= {arXiv preprint arXiv:1409.8498},
  year   = {2018}
}