结合元策略与蒙特卡洛规划实现部分可观测环境中可扩展的基于类型推理
人工智能
2023-06-12 v1 多智能体系统
摘要
设计能够与其他智能体在无先验协调情况下有效交互的自主智能体是多智能体系统中的核心问题。基于类型的推理方法通过维持对其他智能体一组潜在行为的信念来实现这一点。然而,现有方法存在局限:它们假设对其他智能体的状态和动作完全可观测,或无法高效扩展到具有更长规划视野的更大问题。为解决这些局限,我们提出部分可观测基于类型的元蒙特卡洛规划(POTMMCP)——一种基于在线蒙特卡洛树搜索的规划方法,用于大型部分可观测环境中的基于类型推理。POTMMCP引入了一种新颖的元策略用于引导搜索和评估信念,使其能用更少的规划时间在更长视野上更有效地搜索。我们展示了我们的方法在极限情况下收敛到最优解,并通过实证证明它能在线有效适应多种环境中多样的其它智能体。在具有多达个状态和个观测的问题上与state-of-the-art方法的比较表明,POTMMCP能够显著更快地计算出更优解。
引用
@article{arxiv.2306.06067,
title = {Combining a Meta-Policy and Monte-Carlo Planning for Scalable Type-Based Reasoning in Partially Observable Environments},
author = {Jonathon Schwartz and Hanna Kurniawati and Marcus Hutter},
journal= {arXiv preprint arXiv:2306.06067},
year = {2023}
}
备注
24 pages