中文

Kaleidoscope:用于异构多智能体强化学习的可学习掩码

机器学习 2024-10-14 v1 人工智能 多智能体系统

摘要

在多智能体强化学习 (MARL) 中,通常会采用参数共享以提高样本效率。然而,完全参数共享的流行方法会导致智能体之间策略homogeneous,可能限制了从策略多样性中获得的性能收益。为解决这一关键限制,我们引入了 \emph{Kaleidoscope},一种新的自适应部分参数共享方案,通过保持高样本效率来促进策略异构性。具体而言,Kaleidoscope 在保持一组公共参数的同时,为不同智能体维护多个独立、可学习的掩码,以决定参数的共享方式。通过鼓励这些掩码之间的差异,Kaleidoscope 在不牺牲参数共享效率的前提下,促进了策略网络之间的多样性。这种设计使 Kaleidoscope 能够动态平衡高样本效率与广泛的策略表示容量,在 various 环境中有效地弥合了完全参数共享与非参数共享之间的差距。我们进一步将 Kaleidoscope 扩展到 actor-critic 算法中的 critic 集团,这有助于改进价值估计。我们的实证评估覆盖了包括多智能体粒子环境、MuJoCo 以及星际争霸多智能体挑战 v2 在内的广泛环境,结果表明 Kaleidoscope 在与现有参数共享方法相比下表现出优越性能,展示了其在 MARL 中实现性能提升的潜力。代码已公开于 \url{https://github.com/LXXXXR/Kaleidoscope}。

关键词

引用

@article{arxiv.2410.08540,
  title  = {Kaleidoscope: Learnable Masks for Heterogeneous Multi-agent Reinforcement Learning},
  author = {Xinran Li and Ling Pan and Jun Zhang},
  journal= {arXiv preprint arXiv:2410.08540},
  year   = {2024}
}

备注

Accepted by the Thirty-Eighth Annual Conference on Neural Information Processing Systems(NeurIPS 2024)