中文

部分可观测下基于宏动作的多智能体/机器人深度强化学习

人工智能 2022-10-12 v2 多智能体系统 机器人学

摘要

最先进的多智能体强化学习(MARL)方法已为多种复杂问题提供了有前景的解决方案。然而,这些方法都假设智能体执行同步的原语动作,因此它们无法真正扩展到长视野现实世界多智能体/机器人任务——这类任务本质上要求智能体/机器人在不同时间长度上异步地推理高层动作选择。宏动作分散式部分可观测马尔可夫决策过程(MacDec-POMDP)是完全合作多智能体任务中不确定性下异步决策的通用形式化。在本论文中,我们首先提出一组面向 MacDec-POMDP 的基于价值的 RL 方法,其中智能体可在三种范式下利用宏动作值函数进行异步学习与决策:分散式学习与控制、集中式学习与控制、以及集中训练分散执行(CTDE)。在上述工作基础上,我们于三种训练范式下 formulate 一组基于宏动作的策略梯度算法,其中智能体可以异步方式直接优化其参数化策略。我们在仿真和真实机器人上于多种现实领域评估了我们的方法。实证结果表明了我们的方法在大型多智能体问题中的优越性,并验证了我们的算法在学习高质量异步宏动作解方面的有效性。

关键词

引用

@article{arxiv.2209.10003,
  title  = {Macro-Action-Based Multi-Agent/Robot Deep Reinforcement Learning under Partial Observability},
  author = {Yuchen Xiao},
  journal= {arXiv preprint arXiv:2209.10003},
  year   = {2022}
}

备注

PhD thesis