在受管理的随机博弈中无遗憾地共享信息
最优化与控制
2014-12-31 v1 计算机科学与博弈论
多智能体系统
摘要
本文考虑多玩家重复博弈中的信息共享。每一轮,每个玩家观测到一个随机向量的一部分分量,然后采取一个控制动作。每个玩家获得的效用依赖于完整的随机向量以及他人的动作。一个例子是这样一个博弈:多个位置上设有不同奖励,每个玩家仅知道其中一部分位置的奖励,且玩家们竞争以收集奖励。共享信息可帮助他人,但也可能加剧对理想位置的竞争。标准的纳什均衡和相关均衡概念在此情形下是不充分的。相反,本文发展了一种算法,其中每一轮所有玩家将其信息和意图动作传递给一个博弈管理者。管理者为每位玩家提供建议动作,若被采纳,则在约束每位玩家所获得的平均效用不低于其不共享时的平均效用的前提下,最大化平均效用的一个凹函数。该算法利用每轮给出的信息在线行动,且不需要随机事件或玩家动作的具体模型。因此,本文的分析结果适用于非遍历情形以及人类玩家所采取的任何动作序列。
引用
@article{arxiv.1412.8736,
title = {Sharing Information Without Regret in Managed Stochastic Games},
author = {Michael J. Neely},
journal= {arXiv preprint arXiv:1412.8736},
year = {2014}
}
备注
14 pages, 2 figures