SCOPE-RL:一个用于离线强化学习与离屏策略评估的 Python 库
机器学习
2024-03-12 v3 人工智能
摘要
本文介绍 SCOPE-RL,一个专为离线强化学习(offline RL)、离屏策略评估(OPE)与选择(OPS)设计的综合性开源 Python 软件。与多数仅关注策略学习或评估的现有库不同,SCOPE-RL 无缝集成了这两大关键方面,从而实现对离线 RL 与 OPE 流程灵活且完整的实现。SCOPE-RL 特别侧重其 OPE 模块,提供一系列 OPE 估计量与稳健的 OPE 评估协议。该方法相较其他包可实现更深入、更可靠的 OPE。例如,SCOPE-RL 通过估计策略下的整体奖励分布而非仅其逐点期望值来强化 OPE。此外,SCOPE-RL 通过呈现 OPE 结果中的风险-收益权衡,提供了更彻底的 OPE 评估,超越了现有 OPE 文献中单纯的精度评估。SCOPE-RL 以用户易用性为设计初衷。其友好 API、完备文档与丰富易循示例,助力研究者和从业者依其具体问题场景高效实现并实验各类离线 RL 方法与 OPE 估计量。SCOPE-RL 文档见 https://scope-rl.readthedocs.io/en/latest/。
引用
@article{arxiv.2311.18206,
title = {SCOPE-RL: A Python Library for Offline Reinforcement Learning and Off-Policy Evaluation},
author = {Haruka Kiyohara and Ren Kishimoto and Kosuke Kawakami and Ken Kobayashi and Kazuhide Nakata and Yuta Saito},
journal= {arXiv preprint arXiv:2311.18206},
year = {2024}
}
备注
preprint, open-source software: https://github.com/hakuhodo-technologies/scope-rl