通过行为经济学实现无限时域一般和马尔可夫博弈的收敛 Q 学习
计算机科学与博弈论
2025-08-13 v1
摘要
风险规避和有限理性是人类决策的两个关键特征。风险规避的量子响应均衡(RQE)是一个融合了这些特征的解概念,与纳什均衡相比,它能更真实地描绘人类在各种策略环境中的决策。此外,最近在 arXiv:2406.14156 中证明,一类 RQE 在所有有限时域马尔可夫博弈中都是普遍计算可处理的,从而允许开发具有收敛保证的多智能体强化学习算法。在本文中,我们扩展了对 RQE 的研究,并分析了它们在双人标准式博弈和折扣无限时域马尔可夫博弈中的计算。对于标准式博弈,我们采用基于单调性的方法,使我们能够推广先前的结果。我们首先在单调性假设下证明了 RQE 相对于玩家支付矩阵的唯一性和 Lipschitz 连续性,然后提供了确保单调性的玩家风险规避程度和有限理性条件。随后,我们专注于折扣无限时域马尔可夫博弈。我们定义了风险规避的量子响应贝尔曼算子,并在玩家风险规避、有限理性和时间折扣的进一步条件下证明了其压缩性。这产生了一个基于 Q 学习的算法,该算法对所有无限时域一般对手马尔可夫博弈具有收敛保证。
引用
@article{arxiv.2508.08669,
title = {Convergent Q-Learning for Infinite-Horizon General-Sum Markov Games through Behavioral Economics},
author = {Yizhou Zhang and Eric Mazumdar},
journal= {arXiv preprint arXiv:2508.08669},
year = {2025}
}