利用多智能体 MDP 中树依赖结构的快速衰减与局部性
最优化与控制
2019-09-17 v1 机器学习
摘要
本文考虑一个多智能体马尔可夫决策过程(MDP),其中有 个智能体,每个智能体 关联一个取自有限集合的状态 和动作 。尽管全局状态空间大小与动作空间大小关于 是指数的,我们施加局部依赖结构并关注仅依赖于局部状态的局部策略,且当依赖结构为有向树时,我们提出一种在 的多项式时间内找到近似最优局部策略的方法。该算法建立在近似奖励函数之上,这些函数使用局部截断马尔可夫过程评估。进一步,在某些特殊条件下,我们证明近似奖励函数与真实奖励函数之间的差距随着截断马尔可夫过程长度增加而指数快速衰减。其背后的直觉是,在某些假设下,智能体交互的影响随智能体间距离呈指数衰减,我们称之为“快速衰减性质”。
引用
@article{arxiv.1909.06900,
title = {Exploiting Fast Decaying and Locality in Multi-Agent MDP with Tree Dependence Structure},
author = {Guannan Qu and Na Li},
journal= {arXiv preprint arXiv:1909.06900},
year = {2019}
}
备注
10 pages, 3 figures. Accepted to CDC 2019