高维强化学习中基于核与神经网络逼近的 $L^2$ 分析
机器学习
2022-02-17 v3
摘要
基于高维函数逼近的强化学习(RL)算法已在具有海量状态的大规模问题中取得巨大经验成功。然而,对此类算法的大部分分析给出的误差界要么涉及状态数,要么涉及特征数。本文考虑在带有显式正则化的拟合 Q-迭代(fitted Q-iteration)算法背景下,使用核方法或两层神经网络模型进行函数逼近的情形。我们针对最优策略建立了 的误差界,其中使用了 个样本, 为每轮片段的长度, 为动作空间的大小。我们的分析关键在于利用 个数据点分析逼近 Q-函数的 误差。尽管该结果仍要求有限大小的行动空间,其误差界与状态空间的维数无关。
引用
@article{arxiv.2104.07794,
title = {An $L^2$ Analysis of Reinforcement Learning in High Dimensions with Kernel and Neural Network Approximation},
author = {Jihao Long and Jiequn Han and Weinan E},
journal= {arXiv preprint arXiv:2104.07794},
year = {2022}
}