基于最优响应与更优响应的二人对称博弈中的评估与学习
计算机科学与博弈论
2022-04-28 v1
摘要
人工智能与机器人竞赛伴随着一类博弈范式,其中每个参与者私下向博弈系统提交策略,系统根据收集的联合策略模拟博弈并向参与者返回收益。本文考虑二人对称博弈中的策略提交问题,其中参与者的策略空间相同且收益对称。首先,我们基于汇平衡(sink equilibrium),在元层面引入了两个基于有向图的度量,用于双智能体强化学习中的策略评估。这些度量对单个参与者的策略进行排序,并确定适合私下提交的策略集合。然后,为了在这些度量下寻找优选策略,我们提出了经典学习算法自博弈(self-play)的两种变体,分别称为严格最优响应自博弈和弱更优响应自博弈。通过将学习过程建模为在联合策略响应有向图上的游走,我们证明了两种变体学到的策略分别在两种度量下是优选的。我们识别了两种度量下的优选策略,并证明了由一种度量和一种变体诱导的邻接矩阵是连通的。最后,提供了仿真以说明结果。
引用
@article{arxiv.2204.12791,
title = {Evaluation and Learning in Two-Player Symmetric Games via Best and Better Responses},
author = {Rui Yan and Weixian Zhang and Ruiliang Deng and Xiaoming Duan and Zongying Shi and Yisheng Zhong},
journal= {arXiv preprint arXiv:2204.12791},
year = {2022}
}
备注
11 pages, 6 figures