近乎无 horizon 依赖的离线强化学习
机器学习
2022-02-11 v3 机器学习
摘要
我们重新审视基于情景时间齐次马尔可夫决策过程(MDP)的离线强化学习。对于具有 个状态和 个动作的表格 MDP,或具有锚点和特征维度 的线性 MDP,给定收集的 幕数据且(锚点)状态-动作对的最小访问概率为 ,当总奖励上界为 时,我们获得了离线强化学习近乎无 horizon 依赖的样本复杂度界。具体而言:1. 对于离线策略评估,我们获得插件估计量的 误差界,该界在对数因子范围内匹配下界,且高阶项中不额外依赖 。2. 对于离线策略优化,我们获得经验最优策略的 次优差距,在对数因子和高阶项范围内接近下界,改进了 \cite{cui2020plug} 已知最佳结果中主项额外含有 因子的情形。据我们所知,这是针对情景时间齐次离线表格 MDP 和带锚点线性 MDP 的\emph{第一组}近乎无 horizon 依赖的界。我们分析的核心是一种简单而有效的基于递归的方法,用于界定离线场景中的“总方差”项,该方法本身可能具有独立意义。
引用
@article{arxiv.2103.14077,
title = {Nearly Horizon-Free Offline Reinforcement Learning},
author = {Tongzheng Ren and Jialian Li and Bo Dai and Simon S. Du and Sujay Sanghavi},
journal= {arXiv preprint arXiv:2103.14077},
year = {2022}
}
备注
NeurIPS 2021