中文

基于宏动作的深度多智能体强化学习

机器学习 2021-10-19 v2 人工智能 机器人学

摘要

在现实世界的多机器人系统中,执行高质量协作行为要求机器人在不同时间跨度上异步地推理高层动作选择。宏动作去中心化部分可观测马尔可夫决策过程(MacDec-POMDPs)为完全协作多智能体任务中的不确定性下的异步决策提供了一个通用框架。然而,多智能体深度强化学习方法此前仅针对(同步的)原语动作问题开发。本文提出两种基于深度Q网络(DQN)的方法,用于学习去中心化与中心化的宏动作价值函数,并为每种情况引入了新颖的宏动作轨迹回放缓冲区。在基准问题与一个更大领域上的评估证明了使用宏动作学习相较于原语动作学习的优势,以及我们方法的可扩展性。

关键词

引用

@article{arxiv.2004.08646,
  title  = {Macro-Action-Based Deep Multi-Agent Reinforcement Learning},
  author = {Yuchen Xiao and Joshua Hoffman and Christopher Amato},
  journal= {arXiv preprint arXiv:2004.08646},
  year   = {2021}
}