极小极大离线强化学习的有限样本分析:完备性、快速率与一阶有效性
机器学习
2022-07-26 v2 统计理论
机器学习
统计理论
摘要
我们利用函数逼近,在边际重要性权重与 函数通过近期极小极大方法估计时,对强化学习中的离屏评估(OPE)给出理论刻画。在可实性与完备性假设的各种组合下,我们证明极小极大方法使我们能够对权重与价值函数实现由临界不等式(\citep{bartlett2005})刻画的快速收敛率。基于该结果,我们分析了 OPE 的收敛速率。特别地,我们引入了新颖的替代完备性条件,在此条件下 OPE 可行,并且我们给出了非表格环境中具有一阶有效性(即主导项具有最小系数)的首个有限样本结果。
引用
@article{arxiv.2102.02981,
title = {Finite Sample Analysis of Minimax Offline Reinforcement Learning: Completeness, Fast Rates and First-Order Efficiency},
author = {Masatoshi Uehara and Masaaki Imaizumi and Nan Jiang and Nathan Kallus and Wen Sun and Tengyang Xie},
journal= {arXiv preprint arXiv:2102.02981},
year = {2022}
}
备注
Under Review