中文

多智能体强化学习中基于奇异度的探索

机器学习 2022-12-29 v1 人工智能 多智能体系统

摘要

高效的探索策略是需要复杂协作的协作式多智能体强化学习(MARL)算法中的基本问题之一。在本研究中,我们引入了一种基于奇异度(strangeness)的新探索方法,该方法可轻松集成到任何集中训练与分散执行(CTDE)为基础的 MARL 算法中。奇异度指的是智能体所访问观测的陌生程度。为使观测奇异度具备全局视角,还将其与所访问整体状态的陌生程度相增强。探索奖励由奇异度获得,且所提探索方法不太受 MARL 任务中常见的随机转移影响。为防止高探索奖励使 MARL 训练对外部奖励不敏感,我们还提出了一个由外部奖励和探索奖励共同训练的独立动作值函数,并基于该函数设计用于生成转移的行为策略。这使得 CTDE 为基础的 MARL 算法在与探索方法结合使用时更加稳定。通过在教学示例和 StarCraft Multi-Agent Challenge 中的对比评估,我们表明所提探索方法在 CTDE 为基础的 MARL 算法中取得了显著的性能提升。

关键词

引用

@article{arxiv.2212.13448,
  title  = {Strangeness-driven Exploration in Multi-Agent Reinforcement Learning},
  author = {Ju-Bong Kim and Ho-Bin Choi and Youn-Hee Han},
  journal= {arXiv preprint arXiv:2212.13448},
  year   = {2022}
}

备注

9 pages, 7 figures