中文

随机微分博弈的深度虚拟博弈方法

最优化与控制 2020-09-07 v3 计算机科学与博弈论 机器学习

摘要

本文中,我们应用虚拟博弈(fictitious play)的思想来设计深度神经网络(DNNs),并发展深度学习理论与算法以计算非对称NN人非零和随机微分博弈的纳什均衡,我们称之为深度虚拟博弈(deep fictitious play),一个多阶段学习过程。具体而言,在每个阶段,我们提出让个体参与者在其余参与者先前动作条件下优化自身收益的策略,等价于求解NN个解耦的随机控制优化问题,这些问题由DNNs逼近。因此,虚拟博弈策略导出了由NN个DNNs组成的结构,它们仅在每阶段结束时通信。所得到的基于虚拟博弈的深度学习算法可扩展、并行且无需模型(model-free),即利用GPU并行化,它可应用于具有不同对称性与异质性(例如主要参与者的存在)的任意NN人随机微分博弈。我们通过与线性二次博弈的闭式解比较来说明该深度学习算法的性能。此外,我们在适当假设下证明了虚拟博弈的收敛性,并验证收敛极限构成开环纳什均衡。最后我们还讨论了基于虚拟博弈设计的其他策略及闭环纳什均衡的扩展。

关键词

引用

@article{arxiv.1903.09376,
  title  = {Deep Fictitious Play for Stochastic Differential Games},
  author = {Ruimeng Hu},
  journal= {arXiv preprint arXiv:1903.09376},
  year   = {2020}
}