强化学习中离屏策略评估的实证研究
机器学习
2021-11-30 v3 人工智能
机器人学
机器学习
摘要
我们为强化学习中的离屏策略评估(OPE)提供了一个实验基准与实证研究,这是许多安全关键应用中的关键问题。随着基于学习的部署方法日益受到关注,近期涌现出大量 OPE 方法提案,从而需要对 OPE 方法进行标准化实证分析。我们的工作高度重视实验设计的多样性,以对 OPE 方法进行压力测试。我们提供了一个全面的基准测试套件,用以研究不同属性对方法性能的交互影响。我们将结果提炼为一套用于实际 OPE 的概要性指南。我们的软件包,即 Caltech OPE Benchmarking Suite (COBS),已开源,并邀请感兴趣的研究者进一步贡献于该基准。
引用
@article{arxiv.1911.06854,
title = {Empirical Study of Off-Policy Policy Evaluation for Reinforcement Learning},
author = {Cameron Voloshin and Hoang M. Le and Nan Jiang and Yisong Yue},
journal= {arXiv preprint arXiv:1911.06854},
year = {2021}
}