多变矩阵竞争梯度下降
机器学习
2021-11-17 v1 多智能体系统
最优化与控制
摘要
许多经济博弈与机器学习方法都可归结为竞争优化问题,其中多个智能体在最小化各自的目标函数,而这些函数依赖于所有智能体的行动。虽然梯度下降是单智能体优化中可靠的基本工具,但在竞争优化中常导致振荡。本文提出多变矩阵竞争梯度下降(PCGD)作为一种求解涉及任意数量智能体的通用和竞争优化的方法。我们方法的更新通过带二次正则化的局部多变矩阵近似的纳什均衡得到,并可通过求解线性方程组高效计算。我们证明了 PCGD 对 人通用和博弈局部收敛到稳定不动点,并表明其无需根据智能体交互强度调整步长。我们利用 PCGD 在多智能体强化学习中优化策略,并在贪吃蛇、马尔可夫足球和电力市场博弈中展示了其优势。在贪吃蛇和马尔可夫足球博弈以及电力市场博弈中,由 PCGD 训练的智能体优于用同步梯度下降、辛梯度调整和外梯度训练的智能体;在电力市场博弈中,PCGD 比同步梯度下降和外梯度方法训练更快。
引用
@article{arxiv.2111.08565,
title = {Polymatrix Competitive Gradient Descent},
author = {Jeffrey Ma and Alistair Letcher and Florian Schäfer and Yuanyuan Shi and Anima Anandkumar},
journal= {arXiv preprint arXiv:2111.08565},
year = {2021}
}