多智能体环境中的学习综述:应对非平稳性
多智能体系统
2019-03-13 v2 机器学习
摘要
多智能体学习的关键挑战是学习对其他智能体行为的最佳响应,这些行为可能是非平稳的:如果其他智能体也调整其策略,学习目标就会移动。不同的研究流派从多个角度探讨了非平稳性,做出了各种隐含假设,这使得很难对最新进展保持全局概览,也难以验证新工作的创新性和重要性。本综述提供了一个连贯的概览,介绍了利用博弈论、强化学习和多臂赌博机工具解决由对手引起的非平稳性的工作。此外,我们反思了算法如何建模和应对这种非平稳性的主要方法,提出了一个新框架和五个类别(按复杂度递增顺序):忽略、遗忘、响应目标模型、学习模型和心智理论。使用这些类别以及环境的关键特征(如可观测性)和对手的适应行为(如平滑、突变),将广泛的最新算法分类为一个分类法。为了进一步澄清,我们给出了一个领域的说明性变体,对比了每个类别的优势和局限性。最后,我们讨论了不同方法在哪些环境中产生最大价值,并指出了未来研究的有希望的方向。
引用
@article{arxiv.1707.09183,
title = {A Survey of Learning in Multiagent Environments: Dealing with Non-Stationarity},
author = {Pablo Hernandez-Leal and Michael Kaisers and Tim Baarslag and Enrique Munoz de Cote},
journal= {arXiv preprint arXiv:1707.09183},
year = {2019}
}
备注
64 pages, 7 figures. Under review since November 2016