中文

合作多智能体强化学习的高效情景记忆利用

机器学习 2024-03-08 v2 多智能体系统

摘要

在合作多智能体强化学习 (MARL) 中,智能体旨在实现一个共同目标,例如击败敌人或进球得分。现有的 MARL 算法虽然有效,但仍需要大量学习时间,并且经常被复杂任务困在局部最优中,随后无法发现达到目标的策略。为了解决这个问题,我们为 MARL 引入了高效情景记忆利用 (EMU),具有两个主要目标: 通过利用来自情景缓冲区的语义连贯记忆来加速强化学习; 选择性地促进理想的转移以防止局部收敛。为了实现,EMU 在 MARL 旁边结合了可训练的编码器/解码器结构,创建连贯的记忆嵌入,从而促进探索性记忆回溯。为了实现,EMU 引入了一种基于状态期望程度的称为情景激励的新型奖励结构。该奖励改进了 Q-learning 中的 TD 目标,并作为对理想转移的额外激励。我们为所提出的激励提供了理论支持,并证明了 EMU 与传统情景控制相比的有效性。所提出的方法在 StarCraft II 和 Google Research Football 中进行了评估,实证结果表明其性能进一步优于现有最先进方法。

关键词

引用

@article{arxiv.2403.01112,
  title  = {Efficient Episodic Memory Utilization of Cooperative Multi-Agent Reinforcement Learning},
  author = {Hyungho Na and Yunkyeong Seo and Il-chul Moon},
  journal= {arXiv preprint arXiv:2403.01112},
  year   = {2024}
}

备注

Accepted at ICLR 2024