基于个体贡献的内在探索脚手架用于多智能体强化学习
机器学习
2024-05-29 v1 人工智能
多智能体系统
摘要
在多智能体强化学习(MARL)中,有效的探索尤其在稀疏奖励环境中至关重要。虽然引入全局内在奖励可以促进此类环境下的探索,但往往会使代理人之间的信用分配变得复杂。为解决这一困难,我们提出了将个体贡献作为内在探索脚手架(Individual Contributions as intrinsic Exploration Scaffolds, ICES)的新方法,通过从全局视角评估每个代理人的贡献来激励探索。具体而言,ICES利用贝叶斯惊讶值构建探索脚手架,利用集中训练期间的全局转换信息。这些脚手架仅用于训练,可帮助引导各个代理人采取对全局潜在状态转换具有重大影响的动作。此外,ICES将探索策略与利用策略分离,使前者能够在训练期间利用特权的全局信息。针对稀疏奖励下的合作基准任务进行了广泛实验,包括Google Research Football(GRF)和StarCraft Multi-agent Challenge(SMAC),结果表明ICES在探索能力方面优于基线方法。代码已公开发布于 https://github.com/LXXXXR/ICES。
引用
@article{arxiv.2405.18110,
title = {Individual Contributions as Intrinsic Exploration Scaffolds for Multi-agent Reinforcement Learning},
author = {Xinran Li and Zifan Liu and Shibo Chen and Jun Zhang},
journal= {arXiv preprint arXiv:2405.18110},
year = {2024}
}
备注
Accepted by the Forty-first International Conference on Machine Learning