中文

Bellman:TensorFlow中基于模型的强化学习工具箱

机器学习 2021-04-14 v2

摘要

在过去的十年中,无模型强化学习(RL)为机器人等具有挑战性的领域提供了解决方案。基于模型的RL在智能体-环境交互方面显示出比无模型方法更具样本效率的前景,因为模型能够外推到未见过的情况。在更近的过去,基于模型的方法在一些具有非线性状态转移的具有挑战性的领域中表现出优于无模型方法的结果。同时,已经显而易见的是,RL尚未做好市场化准备,并且许多现实世界应用将需要基于模型的方法,因为无模型方法样本效率过低且在训练早期阶段表现不佳。后者在工业界尤为重要,例如在直接影响公司收入的生产系统中。这证明了需要一个工具箱来推进基于模型的RL的边界。虽然有无数用于无模型RL的工具箱,但基于模型的RL在工具箱开发方面很少受到关注。Bellman旨在填补这一空白,并引入了第一个使用最先进软件工程实践彻底设计和测试的基于模型的RL工具箱。我们的模块化方法能够将广泛的环境模型与恢复最先进算法的通用基于模型的智能体类相结合。我们还提供了一个实验框架,根据用户定义的评估指标(例如累积奖励)以系统的方式比较无模型和基于模型的智能体。这为新的研究方向铺平了道路,例如研究不一定基于神经网络的不确定性感知环境模型,或开发解决具有现实问题特征的工业驱动基准的算法。

关键词

引用

@article{arxiv.2103.14407,
  title  = {Bellman: A Toolbox for Model-Based Reinforcement Learning in TensorFlow},
  author = {John McLeod and Hrvoje Stojic and Vincent Adam and Dongho Kim and Jordi Grau-Moya and Peter Vrancx and Felix Leibfried},
  journal= {arXiv preprint arXiv:2103.14407},
  year   = {2021}
}