NeoRL:一种面向离线强化学习的近真实世界基准
机器学习
2021-02-09 v2 人工智能
摘要
离线强化学习(RL)旨在从一批已收集的数据中学习一个良好的策略,在训练过程中无需与环境进行额外交互。然而,当前的离线 RL 基准通常存在较大的现实差距,因为它们涉及由高度探索性策略收集的大规模数据集,并且训练后的策略直接在环境中评估。在真实世界情境中,运行高度探索性策略因系统安全而被禁止,数据通常非常有限,且训练好的策略在部署前应经过充分验证。本文提出一个名为 NeoRL 的近真实世界离线 RL 基准,其包含来自多个领域且规模受控的数据集,以及用于策略验证的额外测试数据集。我们在 NeoRL 上评估了现有的离线 RL 算法,并主张策略的性能还应与行为策略的确定性版本进行比较,而非与数据集奖励比较。实证结果表明,在许多数据集上被测离线 RL 算法相对于确定性策略的竞争力下降,且离线策略评估几乎无帮助。NeoRL 套件可在 http://polixir.ai/research/neorl 获取。我们希望本工作能为未来研究提供启示,并在将 RL 部署于真实世界系统时引起更多关注。
引用
@article{arxiv.2102.00714,
title = {NeoRL: A Near Real-World Benchmark for Offline Reinforcement Learning},
author = {Rongjun Qin and Songyi Gao and Xingyuan Zhang and Zhen Xu and Shengkai Huang and Zewen Li and Weinan Zhang and Yang Yu},
journal= {arXiv preprint arXiv:2102.00714},
year = {2021}
}