多智能体强化学习中切勿重复探索
机器学习
2023-08-22 v1 人工智能
多智能体系统
摘要
在多智能体强化学习领域,内在动机已成为探索的关键工具。尽管许多内在奖励的计算依赖于使用神经网络近似器估计变分后验,但这些神经统计近似器表达能力有限,由此引发了一个显著挑战。我们将此挑战定位为“重访”问题,即智能体反复探索任务空间中受限区域。为应对该问题,我们提出一种动态奖励缩放方法。该方法旨在稳定已探索区域中内在奖励的显著波动并促进更广泛探索,从而有效抑制重访现象。我们的实验结果表明了该方法的有效性,在 Google Research Football 与 StarCraft II 微操任务等困难环境(尤其是稀疏奖励设定下)展现出增强的性能。
引用
@article{arxiv.2308.09909,
title = {Never Explore Repeatedly in Multi-Agent Reinforcement Learning},
author = {Chenghao Li and Tonghan Wang and Chongjie Zhang and Qianchuan Zhao},
journal= {arXiv preprint arXiv:2308.09909},
year = {2023}
}