Dec-POMDP 中均衡的蒙特卡洛搜索
人工智能
2023-05-22 v1
摘要
分散式部分可观测马尔可夫决策过程(Dec-POMDPs)将一组协作智能体在随机动态与部分可观测性下设计个体控制器的问题形式化。寻求全局最优是困难的(NEXP 完全),但寻求纳什均衡——每个智能体策略是对其他智能体的最优响应——则更易处理,并允许以有限状态控制器的形式解决无限 horizon 问题。在本文中,我们表明该方法可适用于仅可获得 Dec-POMDP 生成模型(模拟器)的情形。这要求依赖基于模拟的 POMDP 求解器逐节点地构建智能体的 FSC。一个相关过程被用于启发式地导出初始 FSC。在基准上的实验表明,MC-JESP 与现有 Dec-POMDP 求解器具有竞争力,甚至优于许多使用显式模型的离线方法。
引用
@article{arxiv.2305.11811,
title = {Monte-Carlo Search for an Equilibrium in Dec-POMDPs},
author = {Yang You and Vincent Thomas and Francis Colas and Olivier Buffet},
journal= {arXiv preprint arXiv:2305.11811},
year = {2023}
}
备注
Accepted to UAI 2023, preliminary version