中文

零和马尔可夫博弈的平滑策略迭代

机器学习 2022-12-06 v1

摘要

零和马尔可夫博弈(MGs)已成为多智能体系统与鲁棒控制的高效框架,其中通过构建极小极大问题来求解均衡策略。目前,该形式在表格设定下已被充分研究,其中主要通过精确求解最大算子来计算最坏情况值函数。然而,将此类方法扩展至处理复杂任务并非易事,因为在大规模动作空间上求最大值通常十分繁琐。本文提出平滑策略迭代(SPI)算法来近似求解零和 MGs,其中将最大算子替换为加权 LogSumExp(WLSE)函数以获得近最优均衡策略。特别地,对抗策略被用作权重函数,以在动作空间上实现高效采样。我们还证明了 SPI 的收敛性,并基于压缩映射定理分析了其在 \infty -范数下的近似误差。此外,我们通过将 SPI 与函数逼近相结合,提出了一种基于模型的算法,称为平滑对抗 Actor-critic(SaAC)。与 WLSE 函数相关的目标值由采样轨迹评估,随后构造均方误差以优化值函数,并采用梯度上升-下降方法联合优化主角与对抗策略。另外,我们在基于模型的梯度反向传播中引入了重参数化技术,以防止因从随机策略采样而导致的梯度消失。我们在表格与函数逼近两种设定下验证了算法。结果表明,SPI 能以高精度逼近最坏情况值函数,且 SaAC 能大幅稳定训练过程并提升对抗鲁棒性。

关键词

引用

@article{arxiv.2212.01623,
  title  = {Smoothing Policy Iteration for Zero-sum Markov Games},
  author = {Yangang Ren and Yao Lyu and Wenxuan Wang and Shengbo Eben Li and Zeyang Li and Jingliang Duan},
  journal= {arXiv preprint arXiv:2212.01623},
  year   = {2022}
}