中文

Acme:一个分布式强化学习研究框架

机器学习 2022-09-21 v2 人工智能

摘要

深度强化学习(RL)带来了许多近期且突破性的进展。然而,这些进展往往以所训练底层架构规模的增大以及用于训练它们的 RL 算法复杂度的增加为代价。这些增加反过来使研究人员更难快速原型化新想法或复现已发表的 RL 算法。为解决这些问题,本工作描述了 Acme,一个用于构建新颖 RL 算法的框架,其专门设计用于支持由简单、模块化组件构建的智能体,这些组件可用于不同的执行规模。虽然 Acme 的主要目标是提供算法开发框架,其次要目标是提供重要或最先进算法的简单参考实现。这些实现既作为我们设计决策的验证,也是对 RL 研究可复现性的重要贡献。在本工作中,我们描述了 Acme 内做出的主要设计决策,并进一步详述其组件如何用于实现各种算法。我们的实验为若干常见和最先进算法提供了基线,并展示了这些算法如何扩展到更大、更复杂的环境。这凸显了 Acme 的主要优势之一,即它可用于实现大规模分布式 RL 算法,这些算法能在海量规模下运行,同时保持实现本身固有的可读性。本工作呈现了论文的第二版,对应于模块化的增强、对离线、模仿和从演示中学习算法的额外重视,以及作为 Acme 一部分实现的各种新智能体。

关键词

引用

@article{arxiv.2006.00979,
  title  = {Acme: A Research Framework for Distributed Reinforcement Learning},
  author = {Matthew W. Hoffman and Bobak Shahriari and John Aslanides and Gabriel Barth-Maron and Nikola Momchev and Danila Sinopalnikov and Piotr Stańczyk and Sabela Ramos and Anton Raichuk and Damien Vincent and Léonard Hussenot and Robert Dadashi and Gabriel Dulac-Arnold and Manu Orsini and Alexis Jacq and Johan Ferret and Nino Vieillard and Seyed Kamyar Seyed Ghasemipour and Sertan Girgin and Olivier Pietquin and Feryal Behbahani and Tamara Norman and Abbas Abdolmaleki and Albin Cassirer and Fan Yang and Kate Baumli and Sarah Henderson and Abe Friesen and Ruba Haroun and Alex Novikov and Sergio Gómez Colmenarejo and Serkan Cabi and Caglar Gulcehre and Tom Le Paine and Srivatsan Srinivasan and Andrew Cowie and Ziyu Wang and Bilal Piot and Nando de Freitas},
  journal= {arXiv preprint arXiv:2006.00979},
  year   = {2022}
}

备注

This work presents a second version of the paper which coincides with an increase in modularity, additional emphasis on offline, imitation and learning from demonstrations algorithms, as well as various new agents implemented as part of Acme