离线强化学习遗憾值的快速收敛速率
机器学习
2023-07-13 v2 人工智能
最优化与控制
机器学习
摘要
我们研究在无限 horizon 折扣马尔可夫决策过程(MDP)中,由固定行为策略生成的离线数据进行的强化学习的遗憾值。虽然对常见方法(如拟合 -迭代(FQI))的现有分析表明遗憾值以 收敛,但经验表现显示出\emph{远}更快的收敛。在本文中,我们给出了更精细的遗憾值分析,通过提供遗憾值收敛的快速速率来精确刻画这一现象。首先,我们证明给定最优质量函数 的任意估计,其定义策略的遗憾值以由 -估计的点态收敛速率的指数幂给出的速率收敛,从而加速该收敛。指数幂的水平取决于\emph{决策}问题中的噪声水平,而非估计问题。我们以线性和表格 MDP 为例确立了此类噪声水平。其次,我们对 FQI 和 Bellman 残差最小化提供新的分析以建立正确的点态收敛保证。作为特例,我们的结果意味着线性情形下的 遗憾值速率和表格情形下的 遗憾值速率。我们通过将结果扩展到基于估计 的 -收敛速率(而非点态速率)的遗憾值保证,将发现推广到一般函数逼近,其中在非参数 -估计下 保证可在温和条件下确保。
引用
@article{arxiv.2102.00479,
title = {Fast Rates for the Regret of Offline Reinforcement Learning},
author = {Yichun Hu and Nathan Kallus and Masatoshi Uehara},
journal= {arXiv preprint arXiv:2102.00479},
year = {2023}
}