中文

零和马尔可夫博弈中的学习:放宽强可达性与混合时间假设

计算机科学与博弈论 2025-02-11 v3 机器学习

摘要

我们研究无限时域零和马尔可夫博弈中基于收益的去中心化学习。在此设定下,每个玩家仅根据收到的奖励做出决策,既不观察对手的策略或行动,也不共享信息。先前的工作在强可达性和混合时间假设下,建立了有限时间内收敛到近似纳什均衡的结果。我们提出了一种收敛算法,显著放宽了这些假设,仅要求存在一个具有有界可达性和混合时间的单一策略(不一定是已知的)。我们的关键技术创新是引入Tsallis熵正则化来平滑最佳响应策略更新。通过适当调整此正则化,我们确保了充分的探索,从而绕过了先前对MDP的严格假设。通过建立由Tsallis熵正则化器引起的价值和策略更新的新性质,我们证明了有限时间内收敛到近似纳什均衡。

关键词

引用

@article{arxiv.2312.08008,
  title  = {Learning in Zero-Sum Markov Games: Relaxing Strong Reachability and Mixing Time Assumptions},
  author = {Reda Ouhamma and Maryam Kamgarpour},
  journal= {arXiv preprint arXiv:2312.08008},
  year   = {2025}
}