中文

基于双重方差缩减的近最优离线强化学习

机器学习 2021-02-04 v1 人工智能 机器学习

摘要

我们考虑离线强化学习(RL)问题——这是一种动机充分的 RL 设定,旨在仅利用历史数据进行策略优化。尽管其应用广泛,但离线 RL 的理论理解,例如其最优样本复杂度,即使在表格型马尔可夫决策过程(MDP)等基础设定下仍基本开放。本文提出离策略双重方差缩减(OPDVR),一种基于方差缩减的离线 RL 新算法。我们的主要结果表明,在有限 horizon 平稳转移设定下,OPDVR 可证明地利用 O~(H2/dmϵ2)\widetilde{O}(H^2/d_m\epsilon^2) 轮离线数据识别出 ϵ\epsilon-最优策略,其中 HH 为 horizon 长度,dmd_m 为行为策略诱导的最小边缘状态-动作分布。这相比已知最佳上界改进了 HH 倍。此外,我们建立了 Ω(H2/dmϵ2)\Omega(H^2/d_m\epsilon^2) 的信息论下界,证明 OPDVR 在对数因子内是最优的。最后,我们展示 OPDVR 在非平稳转移的有限 horizon MDP 和折扣奖励的无限 horizon MDP 等替代设定下也达到速率最优的样本复杂度。

关键词

引用

@article{arxiv.2102.01748,
  title  = {Near-Optimal Offline Reinforcement Learning via Double Variance Reduction},
  author = {Ming Yin and Yu Bai and Yu-Xiang Wang},
  journal= {arXiv preprint arXiv:2102.01748},
  year   = {2021}
}