中文

解决强化学习中样本复杂度的水平依赖问题

机器学习 2021-11-02 v1 人工智能 数据结构与算法 最优化与控制 机器学习

摘要

最近,理解强化学习中样本复杂度的水平依赖引起了广泛兴趣。值得注意的是,对于水平长度为HH的强化学习环境,先前的工作表明,当状态和动作数量固定时,存在一个可能近似正确(PAC)算法,该算法使用polylog(H)\mathrm{polylog}(H)个环境交互回合即可学习一个O(1)O(1)最优策略。目前尚不清楚polylog(H)\mathrm{polylog}(H)依赖是否必要。在这项工作中,我们通过开发一个算法解决了这个问题,该算法仅使用O(1)O(1)个环境交互回合即可实现相同的PAC保证,完全解决了强化学习中样本复杂度的水平依赖。我们通过(i)建立折扣和有限水平马尔可夫决策过程中值函数之间的联系,以及(ii)马尔可夫决策过程中的一种新颖扰动分析来实现这一界。我们相信我们的新技术具有独立价值,并可应用于强化学习中的相关问题。

关键词

引用

@article{arxiv.2111.00633,
  title  = {Settling the Horizon-Dependence of Sample Complexity in Reinforcement Learning},
  author = {Yuanzhi Li and Ruosong Wang and Lin F. Yang},
  journal= {arXiv preprint arXiv:2111.00633},
  year   = {2021}
}