仿射马尔可夫博弈中的软Bellman均衡:前向求解与逆学习
计算机科学与博弈论
2023-09-11 v2 机器学习
摘要
马尔可夫博弈刻画了随机动态环境中多个参与者的交互。马尔可夫博弈中的每个参与者最大化其期望总折扣奖励,该奖励依赖于其他参与者的策略。我们提出一类称为仿射马尔可夫博弈的马尔可夫博弈,其中仿射奖励函数耦合了参与者的动作。我们引入了一种新的解概念,即软Bellman均衡,其中每个参与者是有限理性的,并选择软Bellman策略,而非如众所周知的纳什均衡概念中的纯理性策略。我们给出了软Bellman均衡存在且唯一的条件,并提出了一种非线性最小二乘算法以在前向问题中计算该均衡。随后,我们通过投影梯度算法解决从观测到的状态-动作轨迹推断参与者奖励参数的逆博弈问题。在捕食者-猎物OpenAI Gym环境中的实验表明,所提算法推断的奖励参数优于基线算法推断的参数:它们将均衡策略与观测策略之间的Kullback-Leibler散度降低了至少两个数量级。
引用
@article{arxiv.2304.00163,
title = {Soft-Bellman Equilibrium in Affine Markov Games: Forward Solutions and Inverse Learning},
author = {Shenghui Chen and Yue Yu and David Fridovich-Keil and Ufuk Topcu},
journal= {arXiv preprint arXiv:2304.00163},
year = {2023}
}