中文

随机最小二乘值迭代的频繁主义后悔界

机器学习 2023-09-11 v7 机器学习

摘要

我们考虑有限时域强化学习(RL)中的探索-利用困境。当状态空间庞大或连续时,传统的表格方法不可行,某种形式的函数近似是必需的。在本文中,我们引入流行的随机最小二乘值迭代(RLSVI)的一种乐观初始化变体,这是一种无模型算法,其探索通过对动作值函数的最小二乘近似施加扰动来引发。在马尔可夫决策过程具有低秩转移动态的假设下,我们证明RLSVI的频繁主义后悔的上界为 O~(d2H2T)\widetilde O(d^2 H^2 \sqrt{T}),其中 d d 为特征维度,H H 为时域,T T 为总步数。据我们所知,这是针对带函数近似的随机探索的首次频繁主义后悔分析。

关键词

引用

@article{arxiv.1911.00567,
  title  = {Frequentist Regret Bounds for Randomized Least-Squares Value Iteration},
  author = {Andrea Zanette and David Brandfonbrener and Emma Brunskill and Matteo Pirotta and Alessandro Lazaric},
  journal= {arXiv preprint arXiv:1911.00567},
  year   = {2023}
}

备注

Minor bug fixes