中文

促进协作式多智能体强化学习的分层任务网络规划

人工智能 2023-06-16 v1 机器学习

摘要

以协作方式探索具有陷阱的稀疏奖励多智能体强化学习(MARL)环境是一项复杂任务。智能体通常无法到达目标状态而陷入陷阱,影响系统整体性能。为克服该问题,我们提出 SOMARL,一种利用先验知识缩减探索空间并辅助学习的框架。在 SOMARL 中,智能体被视为 MARL 环境的一部分,符号知识以树结构嵌入以构建知识层次。该框架具有两层分层结构:高层为融合分层任务网络(HTN)规划与元控制器的混合模块,低层为基于 MARL 的交互模块。HTN 模块与元控制器分别利用分层领域定义语言(HDDL)与选项框架形式化符号知识,获得领域知识与符号选项集。此外,HTN 模块借助领域知识,通过辅助元控制器选择符号选项来引导低层智能体探索。元控制器进一步计算符号选项的内在奖励以约束探索行为,并视需调整 HTN 规划解。我们在 FindTreasure 与 MoveBox 两个基准上评估 SOMARL,结果表明其相对于最先进的 MARL 及基于子目标的 MARL 基线具有显著更优的性能。

关键词

引用

@article{arxiv.2306.08359,
  title  = {Hierarchical Task Network Planning for Facilitating Cooperative Multi-Agent Reinforcement Learning},
  author = {Xuechen Mu and Hankz Hankui Zhuo and Chen Chen and Kai Zhang and Chao Yu and Jianye Hao},
  journal= {arXiv preprint arXiv:2306.08359},
  year   = {2023}
}