关于 zs-POSG 的贝尔曼最优性原理
人工智能
2022-11-16 v2 计算机科学与博弈论
摘要
许多重要的序贯决策问题都通过依赖贝尔曼最优性原理得以高效求解,即利用子问题在原始问题中递归嵌套这一事实。本文中,我们展示了该原理如何应用于(无限 horizon)双人零和部分可观测随机博弈(zs-POSGs):一方面从中央规划者的视角出发,其仅能基于称为占据态的充分统计量进行推理;另一方面将此类问题转化为零和占据马尔可夫博弈(zs-OMGs)。进而,利用值函数在占据空间中的 Lipschitz 连续性,可推导出 HSVI 算法(启发式搜索值迭代)的一个版本,该版本可证明在有限时间内找到 -纳什均衡。
引用
@article{arxiv.2006.16395,
title = {On Bellman's Optimality Principle for zs-POSGs},
author = {Olivier Buffet and Jilles Dibangoye and Aurélien Delage and Abdallah Saffidine and Vincent Thomas},
journal= {arXiv preprint arXiv:2006.16395},
year = {2022}
}
备注
18 pages, 0 figures, 1 algorithm