带函数逼近的 Epsilon-Greedy 强化学习的理论保证
机器学习
2022-06-22 v1
摘要
诸如 epsilon-greedy、softmax 或高斯噪声等近视探索策略在某些强化学习任务中无法高效探索,但在许多其他任务中却表现良好。事实上,在实践中,由于其简单性,它们常被作为首选。但是,这些策略在什么任务中能够成功?我们能否为其良好的性能提供理论保证?尽管这些策略具有突出的实际重要性,但这些关键问题却鲜有研究。本文对此类策略进行了理论分析,并首次为带有近视探索的强化学习提供了遗憾界和样本复杂度界。我们的结果适用于具有有界 Bellman Eluder 维度的情景式 MDP 中基于值函数的算法。我们提出了一种称为近视探索间隙(myopic exploration gap)的新复杂度度量,记为 alpha,它刻画了 MDP、探索策略和给定值函数类的一个结构性质。我们证明了近视探索的样本复杂度与该量的倒数 1 / alpha^2 呈二次缩放关系。我们进一步通过具体例子表明,由于相应的动力学和奖励结构,在近视探索成功的若干任务中,近视探索间隙确实是有利的。
引用
@article{arxiv.2206.09421,
title = {Guarantees for Epsilon-Greedy Reinforcement Learning with Function Approximation},
author = {Christoph Dann and Yishay Mansour and Mehryar Mohri and Ayush Sekhari and Karthik Sridharan},
journal= {arXiv preprint arXiv:2206.09421},
year = {2022}
}
备注
to appear at ICML 2022