一般和 Markov 博弈中的后悔最小化与均衡收敛
机器学习
2025-06-17 v3 人工智能
计算机科学与博弈论
机器学习
摘要
近期大量不可能性结果表明,在具有对抗性对手的 Markov 博弈中,后悔最小化在统计与计算上均不可行。然而,这些结果均未排除在所有参与方采用相同学习过程的假设下实现后悔最小化的可能性。本工作中,我们提出首个(据我们所知)用于一般和 Markov 博弈学习的算法,当所有智能体执行该算法时提供亚线性后悔保证。我们获得的界针对交换后悔(swap regret),因此沿途隐含收敛到相关均衡。我们的算法是去中心化的、计算高效的,且不需要智能体间任何通信。我们的关键观察是,Markov 博弈中通过策略优化的在线学习本质上可归约为一种加权后悔最小化,其未知权重由智能体策略序列的路径长度决定。因此,控制路径长度导致加权后悔目标,对于此类目标,足够自适应的算法提供亚线性后悔保证。
引用
@article{arxiv.2207.14211,
title = {Regret Minimization and Convergence to Equilibria in General-sum Markov Games},
author = {Liad Erez and Tal Lancewicki and Uri Sherman and Tomer Koren and Yishay Mansour},
journal= {arXiv preprint arXiv:2207.14211},
year = {2025}
}