基于收益的非均匀部分非理性博弈:多智能体系统势博弈论协同控制
系统与控制
2011-07-26 v1 最优化与控制
摘要
本文处理一类称为势博弈的策略博弈,并提出一种新颖的学习算法——基于收益的非均匀部分非理性博弈(Payoff-based Inhomogeneous Partially Irrational Play, PIPIP)。该算法基于已有工作中提出的分布式非均匀同步学习(Distributed Inhomogeneous Synchronous Learning, DISL),但与DISL不同,PIPIP允许智能体以指定概率做出非理性决策,即智能体可以从存储在记忆中的过去动作中选择一个效用较低的动作。由于这些非理性决策,我们能够证明集体动作依概率收敛到势函数最大化点。最后,我们通过传感器覆盖问题的实验证明了该算法的有效性。实验表明,即使存在不期望的纳什均衡,该学习算法也能成功引导智能体到达势函数最大化点附近。我们还通过移动密度函数的实验看到,PIPIP对环境变化具有适应性。
引用
@article{arxiv.1107.4838,
title = {Payoff-based Inhomogeneous Partially Irrational Play for Potential Game Theoretic Cooperative Control of Multi-agent Systems},
author = {Tatsuhiko Goto and Takeshi Hatanaka and Masayuki Fujita},
journal= {arXiv preprint arXiv:1107.4838},
year = {2011}
}
备注
28 pages, 11 figures, submitted to IEEE TAC