线性二次零和平均场型博弈:最优性条件与策略优化
最优化与控制
2020-09-02 v1 计算机科学与博弈论
机器学习
摘要
本文在无限时域折扣效用函数下研究具有线性动态与二次代价的零和平均场型博弈 (ZSMFTG)。ZSMFTG 是一类由两个效用和为零的决策者相互竞争以影响大量不可区分智能体的博弈。特别地,本文研究了转移与效用函数依赖于状态、控制器动作以及状态与动作均值的情况。针对开环与闭环控制分析了该博弈的最优性条件,并推导了纳什均衡策略的显式表达式。此外,针对基于模型与基于样本两种框架提出了两种依赖策略梯度的策略优化方法。在基于模型的情形中,梯度利用模型精确计算;而在基于样本的情形中,则使用蒙特卡洛模拟进行估计。数值实验展示了效用函数及两个参与者控制的收敛性。
引用
@article{arxiv.2009.00578,
title = {Linear-Quadratic Zero-Sum Mean-Field Type Games: Optimality Conditions and Policy Optimization},
author = {René Carmona and Kenza Hamidouche and Mathieu Laurière and Zongjun Tan},
journal= {arXiv preprint arXiv:2009.00578},
year = {2020}
}