中文

Braxlines:超越奖励最大化的、快速的 RL 驱动行为工程交互式工具包

机器学习 2021-10-12 v1 人工智能

摘要

连续控制的目标是合成期望的行为。在强化学习(RL)驱动的方法中,这通常通过精心设计的任务奖励工程以高效探索并运行现成 RL 算法来实现。尽管奖励最大化是 RL 的核心,但奖励工程并非指定复杂行为的唯一——有时也非最简单——方式。本文中,我们介绍 braxlines,一个用于快速、交互式 RL 驱动行为生成的工具包,超越简单奖励最大化,其包含 Composer(一个用于生成连续控制环境的程序化 API),以及针对两类算法族——互信息最大化(MiMax)与散度最小化(DMin)——的一组稳定且充分测试的基线,支持无监督技能学习与分布勾勒作为其他行为指定模式。此外,我们讨论了如何标准化这些算法的评测指标,它们已不能再依赖简单奖励最大化。我们的实现基于 Jax 中硬件加速的 Brax 模拟器并作最小修改,使得行为合成在数分钟训练内完成。我们希望 Braxlines 能作为快速创建与测试环境及行为的交互式工具包,助力未来基准设计以及新型 RL 驱动行为生成模式及其算法研究的爆发。

关键词

引用

@article{arxiv.2110.04686,
  title  = {Braxlines: Fast and Interactive Toolkit for RL-driven Behavior Engineering beyond Reward Maximization},
  author = {Shixiang Shane Gu and Manfred Diaz and Daniel C. Freeman and Hiroki Furuta and Seyed Kamyar Seyed Ghasemipour and Anton Raichuk and Byron David and Erik Frey and Erwin Coumans and Olivier Bachem},
  journal= {arXiv preprint arXiv:2110.04686},
  year   = {2021}
}