中文

近乎无 horizon 依赖的离线强化学习

机器学习 2022-02-11 v3 机器学习

摘要

我们重新审视基于情景时间齐次马尔可夫决策过程(MDP)的离线强化学习。对于具有 SS 个状态和 AA 个动作的表格 MDP,或具有锚点和特征维度 dd 的线性 MDP,给定收集的 KK 幕数据且(锚点)状态-动作对的最小访问概率为 dmd_m,当总奖励上界为 11 时,我们获得了离线强化学习近乎无 horizon HH 依赖的样本复杂度界。具体而言:1. 对于离线策略评估,我们获得插件估计量的 O~(1Kdm)\tilde{O}\left(\sqrt{\frac{1}{Kd_m}} \right) 误差界,该界在对数因子范围内匹配下界,且高阶项中不额外依赖 poly(H,S,A,d)\mathrm{poly}\left(H, S, A, d\right)。2. 对于离线策略优化,我们获得经验最优策略的 O~(1Kdm+min(S,d)Kdm)\tilde{O}\left(\sqrt{\frac{1}{Kd_m}} + \frac{\min(S, d)}{Kd_m}\right) 次优差距,在对数因子和高阶项范围内接近下界,改进了 \cite{cui2020plug} 已知最佳结果中主项额外含有 poly(H,S,d)\mathrm{poly}\left(H, S, d\right) 因子的情形。据我们所知,这是针对情景时间齐次离线表格 MDP 和带锚点线性 MDP 的\emph{第一组}近乎无 horizon 依赖的界。我们分析的核心是一种简单而有效的基于递归的方法,用于界定离线场景中的“总方差”项,该方法本身可能具有独立意义。

关键词

引用

@article{arxiv.2103.14077,
  title  = {Nearly Horizon-Free Offline Reinforcement Learning},
  author = {Tongzheng Ren and Jialian Li and Bo Dai and Simon S. Du and Sujay Sanghavi},
  journal= {arXiv preprint arXiv:2103.14077},
  year   = {2022}
}

备注

NeurIPS 2021