中文

多智能体环境中的学习综述:应对非平稳性

多智能体系统 2019-03-13 v2 机器学习

摘要

多智能体学习的关键挑战是学习对其他智能体行为的最佳响应,这些行为可能是非平稳的:如果其他智能体也调整其策略,学习目标就会移动。不同的研究流派从多个角度探讨了非平稳性,做出了各种隐含假设,这使得很难对最新进展保持全局概览,也难以验证新工作的创新性和重要性。本综述提供了一个连贯的概览,介绍了利用博弈论、强化学习和多臂赌博机工具解决由对手引起的非平稳性的工作。此外,我们反思了算法如何建模和应对这种非平稳性的主要方法,提出了一个新框架和五个类别(按复杂度递增顺序):忽略、遗忘、响应目标模型、学习模型和心智理论。使用这些类别以及环境的关键特征(如可观测性)和对手的适应行为(如平滑、突变),将广泛的最新算法分类为一个分类法。为了进一步澄清,我们给出了一个领域的说明性变体,对比了每个类别的优势和局限性。最后,我们讨论了不同方法在哪些环境中产生最大价值,并指出了未来研究的有希望的方向。

关键词

引用

@article{arxiv.1707.09183,
  title  = {A Survey of Learning in Multiagent Environments: Dealing with Non-Stationarity},
  author = {Pablo Hernandez-Leal and Michael Kaisers and Tim Baarslag and Enrique Munoz de Cote},
  journal= {arXiv preprint arXiv:1707.09183},
  year   = {2019}
}

备注

64 pages, 7 figures. Under review since November 2016