两人零和博弈的深度 SOR Minimax Q 学习
机器学习
2025-11-21 v1
摘要
本文考虑两人零和博弈问题。文献中已发展出并实现了 successive over-relaxation Q 学习算法,显示其对相关 Q-Bellman 算子的结果收敛因子更小,从而加快价值迭代程序的速度。然而,这仅针对表格情形,尚未拓展到通常用于实际高维状态-动作空间的函数逼近设置。此外,此类设置在两人零和博弈中也未被考虑。我们因此提出一种深度 successive over-relaxation minimax Q 学习算法,采用深度神经网络作为函数逼近器,适用于高维空间。我们证明了所提算法的有限时间收敛性。通过数值实验,我们展示所提方法优于现有 Q 学习算法的有效性。我们的消融研究进一步展示了关键 successive over-relaxation 参数不同取值对性能的影响。
引用
@article{arxiv.2511.16226,
title = {Deep SOR Minimax Q-learning for Two-player Zero-sum Game},
author = {Saksham Gautam and Lakshmi Mandal and Shalabh Bhatnagar},
journal= {arXiv preprint arXiv:2511.16226},
year = {2025}
}