有效视界解释了随机环境中深度强化学习的性能
机器学习
2024-04-16 v2 人工智能
机器学习
摘要
强化学习(RL)理论主要集中在证明极小极大样本复杂度界限。这需要使用相对受限的函数类来表示策略或价值函数的战略性探索算法。我们的目标是解释为什么深度强化学习算法在实践中通常表现良好,尽管它们使用的是随机探索和神经网络等更具表达力的函数类。我们的工作给出了一种解释:许多随机 MDP 可以通过对随机策略的 Q 函数执行几步价值迭代,然后贪婪地执行操作来解决。当此条件成立时,我们发现可以将 RL 的探索与学习组件分离开来,使其更容易分析。我们引入了一种新的 RL 算法 SQIRL,该算法通过随机探索收集回放数据,然后在这些回放数据上执行有限步数的拟合 Q 迭代,从而迭代地学习一个接近最优的策略。任何满足基本分布内泛化性质的回归算法都可以在 SQIRL 中用于高效解决常见的 MDP。这可以解释深度 RL 为何有效,因为经验上已确立神经网络在分布内能很好地泛化。此外,SQIRL 解释了为什么随机探索在实践中行之有效。我们利用 SQIRL 推导出了 RL 的实例依赖样本复杂度界限,该界限仅与前瞻的“有效视界”以及用于函数近似的函数类的复杂度呈指数关系。在经验上,我们还发现 SQIRL 的性能在多种随机环境中与 PPO 和 DQN 的性能强相关,这支持了我们的理论分析对实际性能具有预测能力。我们的代码和数据可在 https://github.com/cassidylaidlaw/effective-horizon 获取。
引用
@article{arxiv.2312.08369,
title = {The Effective Horizon Explains Deep RL Performance in Stochastic Environments},
author = {Cassidy Laidlaw and Banghua Zhu and Stuart Russell and Anca Dragan},
journal= {arXiv preprint arXiv:2312.08369},
year = {2024}
}