何时可实现性足以支持离轨强化学习?
机器学习
2023-06-07 v2
摘要
强化学习的无模型算法通常需要一个称为 Bellman 完备性的条件,才能在函数逼近下成功进行离轨操作,除非满足额外条件。然而,Bellman 完备性是一个比可实现性强得多的要求,且被认为在实际中过于严格而难以成立。在本研究中,我们放宽了这一结构假设,并分析了当给定函数类仅满足可实现性时离轨强化学习的统计复杂度。我们为离轨强化学习建立了有限样本保证,这些保证不包含被称为固有 Bellman 误差的逼近误差项,且依赖于三个因素的相互作用。前两个因素是已知的:函数类的度量熵和代表离轨学习代价的集中系数。第三个因素是新的,它衡量了对 Bellman 完备性的违背,即所选函数类与其在 Bellman 算子下的像之间的错位。本质上,这些误差界证明了即使在缺乏 Bellman 完备性的情况下,离轨强化学习在统计上仍然是可行的,并刻画了有利的 Bellman 完备设定与指数下界成立的最坏情况之间的中间状态。我们的分析直接适用于时序差分算法收敛时所得的解。
引用
@article{arxiv.2211.05311,
title = {When is Realizability Sufficient for Off-Policy Reinforcement Learning?},
author = {Andrea Zanette},
journal= {arXiv preprint arXiv:2211.05311},
year = {2023}
}
备注
Appears in ICML 2023 - any feedback is welcome