中文

高维强化学习中基于核与神经网络逼近的 $L^2$ 分析

机器学习 2022-02-17 v3

摘要

基于高维函数逼近的强化学习(RL)算法已在具有海量状态的大规模问题中取得巨大经验成功。然而,对此类算法的大部分分析给出的误差界要么涉及状态数,要么涉及特征数。本文考虑在带有显式正则化的拟合 Q-迭代(fitted Q-iteration)算法背景下,使用核方法或两层神经网络模型进行函数逼近的情形。我们针对最优策略建立了 O~(H3A14n14)\tilde{O}(H^3|\mathcal {A}|^{\frac14}n^{-\frac14}) 的误差界,其中使用了 HnHn 个样本,HH 为每轮片段的长度,A|\mathcal {A}| 为动作空间的大小。我们的分析关键在于利用 nn 个数据点分析逼近 Q-函数的 L2L^2 误差。尽管该结果仍要求有限大小的行动空间,其误差界与状态空间的维数无关。

关键词

引用

@article{arxiv.2104.07794,
  title  = {An $L^2$ Analysis of Reinforcement Learning in High Dimensions with Kernel and Neural Network Approximation},
  author = {Jihao Long and Jiequn Han and Weinan E},
  journal= {arXiv preprint arXiv:2104.07794},
  year   = {2022}
}