中文

在多智能体强化学习中利用语义Epsilon贪婪探索策略

机器学习 2022-01-28 v2 人工智能 多智能体系统

摘要

多智能体强化学习(MARL)可以建模许多现实世界应用。然而,许多MARL方法依赖epsilon贪婪进行探索,这可能会阻碍在困难场景中访问有利状态。在本文中,我们提出一种新方法QMIX(SEG)来处理MARL。它利用值函数分解方法QMIX来训练各智能体策略,以及一种新颖的语义Epsilon贪婪(SEG)探索策略。SEG是对传统epsilon贪婪探索策略的简单扩展,但实验表明其大幅提升了MARL的性能。我们首先将动作聚类为具有相似效果的组,然后在双层epsilon贪婪探索层次结构中使用这些组进行动作选择。我们认为SEG通过在具有比原子动作更丰富语义含义的动作组空间中探索,促进了语义探索。实验表明,QMIX(SEG)大幅优于QMIX,并在StarCraft多智能体挑战(SMAC)基准上取得了与当前最先进MARL方法相竞争的强大性能。

关键词

引用

@article{arxiv.2201.10803,
  title  = {Exploiting Semantic Epsilon Greedy Exploration Strategy in Multi-Agent Reinforcement Learning},
  author = {Hon Tik Tse and Ho-fung Leung},
  journal= {arXiv preprint arXiv:2201.10803},
  year   = {2022}
}