基于推测式对手模型的决策方法
人工智能
2024-03-25 v3 机器学习
多智能体系统
摘要
对手建模已被证明可通过构建对手智能体模型来增强受控智能体的决策能力。然而,现有方法常依赖于获取对手的观测与动作,当此类信息不可观测或难以获取时,该要求便不可行。为解决此问题,我们提出分布式对手辅助多智能体Actor-Critic(DOMAC),这是首个仅依赖局部信息(即受控智能体的观测、动作与奖励)的推测式对手建模算法。具体而言,actor利用定制的推测式对手模型维护对对手的推测信念,该模型仅使用局部信息预测对手动作。此外,DOMAC具备分布式的critic模型,可估计actor策略的回报分布,从而对actor的质量进行更细粒度的评估。这进而更有效地指导actor所依赖的推测式对手模型的训练。进一步地,我们形式化推导了含所提对手模型的策略梯度定理。在MPE、Pommerman和StarCraft Multiagent Challenge(SMAC)中八个不同挑战性多智能体基准任务下的大量实验表明,我们的DOMAC成功建模对手行为,并以更快收敛速度优于最先进方法。
引用
@article{arxiv.2211.11940,
title = {Decision-making with Speculative Opponent Models},
author = {Jing Sun and Shuo Chen and Cong Zhang and Yining Ma and Jie Zhang},
journal= {arXiv preprint arXiv:2211.11940},
year = {2024}
}
备注
13 pages, 27 figures