中文

两人零和博弈的深度 SOR Minimax Q 学习

机器学习 2025-11-21 v1

摘要

本文考虑两人零和博弈问题。文献中已发展出并实现了 successive over-relaxation Q 学习算法,显示其对相关 Q-Bellman 算子的结果收敛因子更小,从而加快价值迭代程序的速度。然而,这仅针对表格情形,尚未拓展到通常用于实际高维状态-动作空间的函数逼近设置。此外,此类设置在两人零和博弈中也未被考虑。我们因此提出一种深度 successive over-relaxation minimax Q 学习算法,采用深度神经网络作为函数逼近器,适用于高维空间。我们证明了所提算法的有限时间收敛性。通过数值实验,我们展示所提方法优于现有 Q 学习算法的有效性。我们的消融研究进一步展示了关键 successive over-relaxation 参数不同取值对性能的影响。

关键词

引用

@article{arxiv.2511.16226,
  title  = {Deep SOR Minimax Q-learning for Two-player Zero-sum Game},
  author = {Saksham Gautam and Lakshmi Mandal and Shalabh Bhatnagar},
  journal= {arXiv preprint arXiv:2511.16226},
  year   = {2025}
}