中文

强化学习中离屏策略评估的实证研究

机器学习 2021-11-30 v3 人工智能 机器人学 机器学习

摘要

我们为强化学习中的离屏策略评估(OPE)提供了一个实验基准与实证研究,这是许多安全关键应用中的关键问题。随着基于学习的部署方法日益受到关注,近期涌现出大量 OPE 方法提案,从而需要对 OPE 方法进行标准化实证分析。我们的工作高度重视实验设计的多样性,以对 OPE 方法进行压力测试。我们提供了一个全面的基准测试套件,用以研究不同属性对方法性能的交互影响。我们将结果提炼为一套用于实际 OPE 的概要性指南。我们的软件包,即 Caltech OPE Benchmarking Suite (COBS),已开源,并邀请感兴趣的研究者进一步贡献于该基准。

关键词

引用

@article{arxiv.1911.06854,
  title  = {Empirical Study of Off-Policy Policy Evaluation for Reinforcement Learning},
  author = {Cameron Voloshin and Hoang M. Le and Nan Jiang and Yisong Yue},
  journal= {arXiv preprint arXiv:1911.06854},
  year   = {2021}
}