随机最小二乘值迭代的频繁主义后悔界
机器学习
2023-09-11 v7 机器学习
摘要
我们考虑有限时域强化学习(RL)中的探索-利用困境。当状态空间庞大或连续时,传统的表格方法不可行,某种形式的函数近似是必需的。在本文中,我们引入流行的随机最小二乘值迭代(RLSVI)的一种乐观初始化变体,这是一种无模型算法,其探索通过对动作值函数的最小二乘近似施加扰动来引发。在马尔可夫决策过程具有低秩转移动态的假设下,我们证明RLSVI的频繁主义后悔的上界为 ,其中 为特征维度, 为时域, 为总步数。据我们所知,这是针对带函数近似的随机探索的首次频繁主义后悔分析。
引用
@article{arxiv.1911.00567,
title = {Frequentist Regret Bounds for Randomized Least-Squares Value Iteration},
author = {Andrea Zanette and David Brandfonbrener and Emma Brunskill and Matteo Pirotta and Alessandro Lazaric},
journal= {arXiv preprint arXiv:1911.00567},
year = {2023}
}
备注
Minor bug fixes