MAMBPO:利用学习到的世界模型实现样本高效的多机器人强化学习
机器人学
2021-03-08 v1 人工智能
多智能体系统
摘要
多机器人系统可以受益于在少量试验中学习行为的强化学习(RL)算法,这一性质被称为样本效率。因此,本研究探讨了利用学习到的世界模型来提升样本效率。我们提出了一种新颖的多智能体基于模型的 RL 算法:多智能体基于模型的策略优化(Multi-Agent Model-Based Policy Optimization, MAMBPO),采用了集中训练分散执行(Centralized Learning for Decentralized Execution, CLDE)框架。CLDE 算法允许一组智能体在训练后以完全分散的方式行动。这对于许多由多个机器人组成的系统而言是一种理想特性。与无模型的 Multi-Agent Soft Actor-Critic (MASAC) 相比,MAMBPO 利用学习到的世界模型来提高样本效率。我们在两个模拟多机器人任务上展示了这一点,其中 MAMBPO 达到了与 MASAC 相似的性能,但所需的样本量少得多。通过此举,我们朝着使多机器人系统的真实环境学习成为可能迈出了重要一步。
引用
@article{arxiv.2103.03662,
title = {MAMBPO: Sample-efficient multi-robot reinforcement learning using learned world models},
author = {Daniël Willemsen and Mario Coppola and Guido C. H. E. de Croon},
journal= {arXiv preprint arXiv:2103.03662},
year = {2021}
}
备注
Submitted to 2021 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2021)