经验中心虚拟博弈:多智能体博弈中的分布式学习方法
最优化与控制
2016-11-17 v2 计算机科学与博弈论
系统与控制
摘要
本文研究大规模博弈中的分布式学习问题。针对著名的虚拟博弈(FP)算法,尽管其具有理论收敛性,但在大规模场景中由于密集的计算和通信需求而难以实际应用。本文提出了一种FP算法的改进版本,称为经验中心虚拟博弈(ECFP)。在ECFP中,玩家响应所有玩家行动的中心,而非跟踪并响应每个玩家的个体行动。在博弈为具有置换不变势函数的势博弈的假设下,证明了ECFP算法在平均经验频率(文中精确界定的概念)意义下收敛到纳什均衡的子集。随后给出了ECFP的更一般形式(将FP作为特例包含在内),并给出了势博弈类别的收敛结果。此外,还提出了ECFP算法的分布式形式,其中玩家拥有(可能稀疏的)预分配通信图,通过局部、非策略性的信息交换最终达成共同均衡。证明了分布式ECFP算法的收敛结果。
引用
@article{arxiv.1304.4577,
title = {Empirical Centroid Fictitious Play: An Approach For Distributed Learning In Multi-Agent Games},
author = {Brian Swenson and Soummya Kar and Joao Xavier},
journal= {arXiv preprint arXiv:1304.4577},
year = {2016}
}
备注
Submitted to the IEEE Transactions on Signal Processing