中文

CPIG:利用一致性策略与意图引导进行多智能体探索

多智能体系统 2024-12-09 v2

摘要

高效探索在合作多智能体强化学习(MARL)中至关重要,尤其是在稀疏奖励环境中。然而,由于依赖单模态策略,现有方法容易陷入局部最优,阻碍了对更优策略的有效探索。此外,在稀疏奖励环境中,每个智能体倾向于获得稀缺的奖励,这对智能体间的合作构成了重大挑战。这不仅增加了策略学习的难度,还降低了多智能体任务的整体性能。为了解决这些问题,我们提出了一种具有意图引导的一致性策略(CPIG),包含两个主要组成部分:(a) 引入多模态策略以增强智能体的探索能力,(b) 在智能体间共享意图以促进合作。对于组成部分(a),CPIG将一致性模型作为策略,利用其多模态特性和随机特性来促进探索。关于组成部分(b),我们引入了一个意图学习器,从每个智能体的局部观测中推断全局状态的意图。该意图随后作为一致性策略的引导,促进智能体间的合作。所提出的方法在多智能体粒子环境(MPE)和多智能体MuJoCo(MAMuJoCo)中进行了评估。实证结果表明,我们的方法不仅在密集奖励环境中与各种基线达到了可比性能,而且在稀疏奖励环境中显著提升了性能,超越了最先进(SOTA)算法20%。

关键词

引用

@article{arxiv.2411.03603,
  title  = {CPIG: Leveraging Consistency Policy with Intention Guidance for Multi-agent Exploration},
  author = {Yuqian Fu and Yuanheng Zhu and Haoran Li and Zijie Zhao and Jiajun Chai and Dongbin Zhao},
  journal= {arXiv preprint arXiv:2411.03603},
  year   = {2024}
}