中文

具有奖励机器层次结构的多智能体强化学习

人工智能 2024-03-13 v1 机器学习 多智能体系统

摘要

在本文中,我们研究利用奖励机器 (RMs) 指定奖励函数的合作多智能体强化学习 (MARL) 问题,以便利用任务中高层事件的先验知识来促进学习效率。与现有将 RMs 纳入 MARL 以在相对简单的领域中进行任务分解和策略学习,或假设智能体之间独立性的工作不同,我们提出了具有奖励机器层次结构的多智能体强化学习 (MAHRM),它能够处理智能体间事件可能并发发生且智能体高度相互依赖的更复杂场景。MAHRM 利用高层事件的关系将任务分解为分配给一小群智能体的更简单子任务的层次结构,从而降低整体计算复杂度。在三个合作 MARL 领域中的实验结果表明,MAHRM 优于使用相同高层事件先验知识的其他 MARL 方法。

关键词

引用

@article{arxiv.2403.07005,
  title  = {Multi-Agent Reinforcement Learning with a Hierarchy of Reward Machines},
  author = {Xuejing Zheng and Chao Yu},
  journal= {arXiv preprint arXiv:2403.07005},
  year   = {2024}
}