强化学习中的离屏策略评估综述
机器学习
2022-12-14 v1 机器学习
统计理论
统计方法学
统计理论
摘要
强化学习(RL)是机器学习中最活跃的研究前沿之一,近年来已被应用于解决若干具有挑战性的问题。在本文中,我们主要关注离屏策略评估(OPE),这是强化学习中最基础的主题之一。近年来,统计学与计算机科学文献中已提出多种OPE方法。我们对OPE的效率界、若干现有最先进的OPE方法、它们的统计性质以及一些当前正被积极探索的其他相关研究方向进行了探讨。
引用
@article{arxiv.2212.06355,
title = {A Review of Off-Policy Evaluation in Reinforcement Learning},
author = {Masatoshi Uehara and Chengchun Shi and Nathan Kallus},
journal= {arXiv preprint arXiv:2212.06355},
year = {2022}
}
备注
Still under revision