中文

URLB:无监督强化学习基准

机器学习 2021-10-29 v1 人工智能 机器人学

摘要

深度强化学习(RL)已成为解决一系列复杂但特定的控制任务的强大范式。然而,训练能够快速适应新任务的通用智能体仍是一项突出挑战。无监督 RL 的最新进展表明,利用自监督内在奖励对 RL 智能体进行预训练可实现高效适应。然而,由于缺乏统一基准,这些算法难以比较与发展。为此,我们引入了无监督强化学习基准(URLB)。URLB 包含两个阶段:无奖励预训练与带外在奖励的下游任务适应。基于 DeepMind Control Suite,我们提供了来自三个领域的十二个连续控制任务用于评估,并开源了八种领先无监督 RL 方法的代码。我们发现所实现的基线取得了进展但尚无法解决 URLB,并提出了未来研究方向。

关键词

引用

@article{arxiv.2110.15191,
  title  = {URLB: Unsupervised Reinforcement Learning Benchmark},
  author = {Michael Laskin and Denis Yarats and Hao Liu and Kimin Lee and Albert Zhan and Kevin Lu and Catherine Cang and Lerrel Pinto and Pieter Abbeel},
  journal= {arXiv preprint arXiv:2110.15191},
  year   = {2021}
}

备注

Code for the Unsupervised Reinforcement Learning Benchmark is available at https://github.com/rll-research/url_benchmark