强化学习离线策略评估中近最优可证明的一致收敛性
机器学习
2020-12-02 v2 人工智能
机器学习
摘要
强化学习(RL)中的离线策略评估(OPE)问题是将 RL 应用于实际生活场景的关键一步。现有关于 OPE 的工作大多集中于评估一个固定的目标策略 ,这无法为离线策略学习提供有用的界,因为此时的 将依赖于数据。我们通过同时评估策略类 中的所有策略——即 OPE 中的一致收敛——来解决该问题,并对若干全局/局部策略类获得了近乎最优的误差界。我们的结果表明,在时变非齐次片段式 MDP 模型下( 为规划时域, 为反映日志策略 探索程度的一个量),基于模型的规划在识别 -最优策略时达到了 的最优片段复杂度。据我们所知,这是首次表明离线 RL 设定下最优速率是可能实现的,且本文是首篇系统研究 OPE 中一致收敛的论文。
引用
@article{arxiv.2007.03760,
title = {Near-Optimal Provable Uniform Convergence in Offline Policy Evaluation for Reinforcement Learning},
author = {Ming Yin and Yu Bai and Yu-Xiang Wang},
journal= {arXiv preprint arXiv:2007.03760},
year = {2020}
}
备注
Short version presented at Offline RL workshop at Neurips, 2020