用于不完全信息多智能体系统最优行为的分布式虚拟博弈
计算机科学与博弈论
2016-02-08 v1 系统与控制
摘要
多智能体系统在一个不确定环境中运行,智能体对该环境持有不同且时变的信念,这些信念随时间推移收敛于一个共同信念。一个依赖于环境实现状态和所有智能体动作的全局效用函数决定了系统的最优行为。我们将渐近最优动作剖面定义为势博弈的均衡,该势博弈通过考虑关于渐近信念的期望效用来定义。然而在有限时间内,智能体对环境状态的信念并不完全一致,可能选择冲突的动作。本文提出了一种虚拟博弈算法的变体,并证明若状态信念以至少线性的速率收敛于公共分布,则该算法收敛至均衡动作。在常规虚拟博弈中,智能体通过计算过去动作的直方图来建立对他人未来行为的信念,并针对这些直方图的期望收益做出最优响应。在此开发的变体中,直方图利用邻近节点采取动作的知识构建,且最优响应进一步关于环境状态的局部信念进行积分。我们在协调与目标覆盖博弈中举例说明了该算法的使用。
引用
@article{arxiv.1602.02066,
title = {Distributed Fictitious Play for Optimal Behavior of Multi-Agent Systems with Incomplete Information},
author = {Ceyhun Eksin and Alejandro Ribeiro},
journal= {arXiv preprint arXiv:1602.02066},
year = {2016}
}