多智能体学习中的探索-利用: catastrophe 理论遇见博弈论
计算机科学与博弈论
2020-12-16 v2 多智能体系统
动力系统
摘要
探索-利用是多智能体学习(MAL)中一种强大且实用的工具,然而其影响远未被理解。为在此方向上取得进展,我们研究 Q-learning 的光滑类比。我们首先表明,我们的学习模型作为研究探索-利用的最优模型具有坚实的理论依据。具体而言,我们证明在显式捕捉博弈成本与探索成本平衡的代价模型下,光滑 Q-learning 在任意博弈中具有有界后悔值,并且在具有异构学习智能体的加权势博弈中总是收敛到量化响应均衡(QRE)集合——即有界理性下博弈的标准解概念。在我们的主要任务中,我们进而衡量探索对集体系统性能的影响。我们刻画了低维 MAL 系统中 QRE 曲面的几何结构,并将发现与 catastrophe(分岔)理论相联系。特别地,随着探索超参数随时间演化,系统经历相变,其中均衡的数量与稳定性可因探索参数的无穷小改变而剧烈变化。基于此,我们提供形式化理论处理,说明调优探索参数如何可证明地导致均衡选择,对系统性能产生正向以及负向(且可能无界)的影响。
引用
@article{arxiv.2012.03083,
title = {Exploration-Exploitation in Multi-Agent Learning: Catastrophe Theory Meets Game Theory},
author = {Stefanos Leonardos and Georgios Piliouras},
journal= {arXiv preprint arXiv:2012.03083},
year = {2020}
}
备注
Appears in the 35th AAAI Conference on Artificial Intelligence