非对称信息动态决策问题的统一方法——第一部分:非策略型智能体
多智能体系统
2018-12-05 v1 最优化与控制
摘要
我们研究一类具有非对称信息和非策略型智能体的通用动态多智能体决策问题,其包含动态团队作为特例。当智能体为非策略型时,一个智能体的策略为其他智能体所知。然而,智能体的策略选择与信念随时间相互依赖,这一现象被称为信号传递。我们引入私有信息的概念,以相互一致的方式有效压缩智能体的信息。基于充分信息的概念,我们为每个智能体提出一个足以用于决策的信息状态。我们给出了动态多智能体决策问题的实例,其中可确定每个智能体具有时不变域的信息状态。此外,我们将部分可观测马尔可夫决策过程(POMDP)中信念的策略无关性质推广到动态多智能体决策问题。在非对称信息动态团队的背景下,所提出的信息状态集合导致了一种序贯分解,解耦了智能体策略与信念随时间的相互依赖,并使我们能够通过反向归纳建立动态规划以确定全局最优策略。
引用
@article{arxiv.1812.01130,
title = {A Unified Approach to Dynamic Decision Problems with Asymmetric Information - Part I: Non-Strategic Agents},
author = {Hamidreza Tavafoghi and Yi Ouyang and Demosthenis Teneketzis},
journal= {arXiv preprint arXiv:1812.01130},
year = {2018}
}