中文

多智能体强化学习中用于 Q 学习的贪心解混方法

机器学习 2021-09-21 v1 多智能体系统 机器学习

摘要

本文提出用于协作式多智能体强化学习(MARL)的贪心解混(GUM)。贪心解混旨在避免由于大规模联合状态-动作空间中的价值过高估计而导致 MARL 方法失效的情形。其旨在通过一种保守 Q 学习方法,限制数据集中的状态边缘分布以避免未观测到的联合状态-动作空间,同时在集中训练与分散执行范式下尝试解混或简化问题空间。我们证明了在 MARL 场景的 Q 学习中遵循 Q 函数下界,并在一组基准 MARL 任务上展示了相较于现有 Q 学习 MARL 方法以及更通用的 MARL 算法的优越性能,尽管其相较于最先进的方法相对简单。

关键词

引用

@article{arxiv.2109.09034,
  title  = {Greedy UnMixing for Q-Learning in Multi-Agent Reinforcement Learning},
  author = {Chapman Siu and Jason Traish and Richard Yi Da Xu},
  journal= {arXiv preprint arXiv:2109.09034},
  year   = {2021}
}