二人零和马尔可夫博弈中极小极大 Q 学习的有限时间分析:切换系统方法
系统与控制
2023-06-13 v2 计算机科学与博弈论
机器学习
系统与控制
摘要
本文的目标是研究应用于二人零和马尔可夫博弈的 Q 学习算法的有限时间分析。具体而言,我们建立了极小极大 Q 学习算法及相应值迭代方法的有限时间分析。为了增强对值迭代和 Q 学习的分析,我们采用极小极大 Q 学习及其相关值迭代的切换系统模型。该方法为极小极大 Q 学习提供了进一步的见解,并促成了更直接且具洞察力的收敛分析。我们期望这些额外见解的引入有潜力揭示控制理论与强化学习领域概念之间的新联系,并促进两个社区间的协作。
引用
@article{arxiv.2306.05700,
title = {Finite-Time Analysis of Minimax Q-Learning for Two-Player Zero-Sum Markov Games: Switching System Approach},
author = {Donghwan Lee},
journal= {arXiv preprint arXiv:2306.05700},
year = {2023}
}
备注
arXiv admin note: text overlap with arXiv:2205.05455