解决强化学习中样本复杂度的水平依赖问题
机器学习
2021-11-02 v1 人工智能
数据结构与算法
最优化与控制
机器学习
摘要
最近,理解强化学习中样本复杂度的水平依赖引起了广泛兴趣。值得注意的是,对于水平长度为的强化学习环境,先前的工作表明,当状态和动作数量固定时,存在一个可能近似正确(PAC)算法,该算法使用个环境交互回合即可学习一个最优策略。目前尚不清楚依赖是否必要。在这项工作中,我们通过开发一个算法解决了这个问题,该算法仅使用个环境交互回合即可实现相同的PAC保证,完全解决了强化学习中样本复杂度的水平依赖。我们通过(i)建立折扣和有限水平马尔可夫决策过程中值函数之间的联系,以及(ii)马尔可夫决策过程中的一种新颖扰动分析来实现这一界。我们相信我们的新技术具有独立价值,并可应用于强化学习中的相关问题。
引用
@article{arxiv.2111.00633,
title = {Settling the Horizon-Dependence of Sample Complexity in Reinforcement Learning},
author = {Yuanzhi Li and Ruosong Wang and Lin F. Yang},
journal= {arXiv preprint arXiv:2111.00633},
year = {2021}
}