非对称信息获取博弈
最优化与控制
2020-09-07 v1
摘要
我们考虑一个具有部分、非对称且非经典信息的随机博弈,其中智能体试图获取尽可能多的可用机会/锁。智能体仅能访问局部信息,信息更新是异步的,我们的目标是获得相关的均衡策略。我们的方法是考虑在信息更新前的最优开环控制,从而以结构化方式管理信念更新。智能体持续控制其 Poisson 搜索时钟的速率以获取锁,并在每次成功获取时获得奖励;若此前所有阶段均成功且智能体最先完成,则获取成功。然而,它们均无法获知其他智能体的获取状态,从而构成一个非对称信息博弈。利用最优控制理论与马尔可夫决策过程(MDP)的标准工具,我们求解了一个双层控制问题;MDP 动态规划方程的每一阶段均使用最优控制工具求解。最终我们将具有无限状态数与无限维动作的博弈化简为具有一维动作的有限状态博弈。我们对某些特殊情况给出了纳什均衡的闭式表达,并对更多情况推导了渐近表达。
引用
@article{arxiv.2009.02053,
title = {Asymmetric Information Acquisition Games},
author = {Vartika Singh and Veeraruna Kavitha},
journal= {arXiv preprint arXiv:2009.02053},
year = {2020}
}
备注
This document contains 10 pages, 4 figures. This will appear at 59th IEEE Conference on Decision and Control (CDC 2020)