中文

用于高效实时多机器人协同探索的异步多智能体强化学习

机器人学 2023-04-12 v2 人工智能

摘要

我们考虑多机器人需尽可能快地协同探索未知区域的问题。多智能体强化学习(MARL)近来成为解决该挑战的趋势性范式。然而,现有基于 MARL 的方法以动作步数作为探索效率的度量,假设所有智能体以完全同步方式行动:即每个智能体同时产生一个动作,且每个动作在每个时间步瞬时执行。尽管数学上简单,此种同步 MARL 公式对真实世界机器人应用可能存在问题。不同机器人完成原子动作所需的实际时钟时间可能略有不同,甚至因硬件问题周期性丢失,这种情况很典型。简单地等待每个机器人准备好下一动作可能特别耗时。因此,我们提出一种异步 MARL 方案,异步协调探索器(ACE),以应对该真实世界挑战。我们首先将经典 MARL 算法多智能体 PPO(MAPPO)扩展到异步设定,并额外施加动作延迟随机化以强制所学策略更好地泛化到真实世界中变化的动作延迟。此外,每个导航智能体表示为团队规模不变的基于 CNN 的策略,其通过处理可能的机器人丢失而极大利于真实机器人部署,并允许通过低维 CNN 特征进行带宽高效的智能体内通信。我们首先在基于网格的场景中验证我们的方法。仿真与真实机器人结果均表明,与经典方法相比,ACE 减少了超过 10% 的实际探索时间。我们还将我们的框架应用于高保真基于视觉的环境 Habitat,实现了 28% 的探索效率提升。

关键词

引用

@article{arxiv.2301.03398,
  title  = {Asynchronous Multi-Agent Reinforcement Learning for Efficient Real-Time Multi-Robot Cooperative Exploration},
  author = {Chao Yu and Xinyi Yang and Jiaxuan Gao and Jiayu Chen and Yunfei Li and Jijia Liu and Yunfei Xiang and Ruixin Huang and Huazhong Yang and Yi Wu and Yu Wang},
  journal= {arXiv preprint arXiv:2301.03398},
  year   = {2023}
}

备注

This paper is accepted by AAMAS 2023. The source code can be found in https://github.com/yang-xy20/async_mappo