线性二次零和平均场型博弈的策略优化
最优化与控制
2020-09-07 v1 计算机科学与博弈论
机器学习
摘要
本文在无限时域折扣效用函数下研究了具有线性动力学和二次效用的零和平均场型博弈(ZSMFTG)。ZSMFTG 是一类由两个效用之和为零的决策者为影响一大群智能体而相互竞争的博弈。特别地,本文研究了转移函数和效用函数依赖于状态、控制器动作以及状态和动作均值的情况。对该博弈进行了分析,并推导出了纳什均衡策略的显式表达式。此外,针对基于模型和基于样本两种框架,提出了两种依赖于策略梯度的策略优化方法。在第一种情况下,梯度利用模型精确计算;而在第二种情况下,梯度通过蒙特卡洛模拟进行估计。数值实验展示了在两种算法用于不同场景时,两个参与者的控制以及效用函数的收敛性。
引用
@article{arxiv.2009.02146,
title = {Policy Optimization for Linear-Quadratic Zero-Sum Mean-Field Type Games},
author = {René Carmona and Kenza Hamidouche and Mathieu Laurière and Zongjun Tan},
journal= {arXiv preprint arXiv:2009.02146},
year = {2020}
}
备注
arXiv admin note: text overlap with arXiv:2009.00578