为什么全局性能是验证多智能体学习收敛性的一个糟糕指标
多智能体系统
2009-04-16 v1 机器学习
摘要
随着智能体数量的增加和理论分析变得极其复杂,实验验证已成为验证多智能体强化学习(MARL)算法稳定性的首选方法。对于合作型智能体,其最终目标是优化某个全局指标,通常通过观察全局性能指标随时间的演变来验证稳定性。如果全局指标改善并最终稳定,则被视为系统稳定性的合理验证。本文的主要贡献在于,论证了需要更好的实验框架和度量标准来评估大规模自适应合作系统的稳定性。我们展示了一个实验案例研究,其中全局性能指标的稳定性可能相当具有欺骗性,它隐藏了系统中潜在的不稳定性,这种不稳定性后来导致了性能的显著下降。然后,我们提出了一种依赖于智能体局部策略的替代指标,并通过实验表明,我们提出的指标在揭示MARL算法的不稳定性方面比传统的全局性能指标更有效。
引用
@article{arxiv.0904.2320,
title = {Why Global Performance is a Poor Metric for Verifying Convergence of Multi-agent Learning},
author = {Sherief Abdallah},
journal= {arXiv preprint arXiv:0904.2320},
year = {2009}
}
备注
11 pages