总期望报酬吸收型马尔可夫博弈的纳什均衡:约束与无约束情形
最优化与控制
2023-05-09 v1
摘要
我们考虑定义在抽象可测状态空间与紧度量动作空间上的非零和N人马尔可夫博弈。支付函数为有界Carathéodory函数,且系统转移假定具有满足若干连续性条件的密度函数。玩家的最优性准则由无限离散时间 horizon 上的总期望支付给出。在博弈模型为吸收型的条件下,我们针对约束与无约束两类问题,均证明了在玩家所有依赖历史策略族中存在构成非合作均衡的马尔可夫策略。作为结果的特例,我们得到了折扣约束与无约束博弈模型纳什均衡的存在性。
引用
@article{arxiv.2305.04514,
title = {Nash equilibria for total expected reward absorbing Markov games: the constrained and unconstrained cases},
author = {François Dufour and Tomás Prieto-Rumeau},
journal= {arXiv preprint arXiv:2305.04514},
year = {2023}
}