中文

一般和博弈中有限步长多智能体学习的收敛性

多智能体系统 2019-03-08 v1 机器学习

摘要

多智能体系统中的学习具有挑战性,因为智能体同时学习且环境非平稳,破坏了收敛保证。为应对此挑战,本文提出一种名为带收缩策略预测的梯度上升(GA-SPP)的基于梯度的学习新算法,其以收缩策略预测概念增强了基本梯度上升方法。该算法背后的关键思想是,智能体针对另一智能体被预测的策略而非其当前策略调整自身策略。形式上,GA-SPP 被证明在比现有基于梯度的多智能体学习方法更大的设定下具有纳什收敛性。此外,与现有基于梯度的方法不同,GA-SPP 的理论保证不假设学习率为无穷小。

关键词

引用

@article{arxiv.1903.02868,
  title  = {Convergence of Multi-Agent Learning with a Finite Step Size in General-Sum Games},
  author = {Xinliang Song and Tonghan Wang and Chongjie Zhang},
  journal= {arXiv preprint arXiv:1903.02868},
  year   = {2019}
}

备注

AAMAS 2019