具有两层神经网络参数化的拟合 Q 迭代的全局收敛性
机器学习
2023-02-01 v2 人工智能
摘要
基于深度 Q 学习的算法已成功应用于许多决策问题,但其理论基础尚不十分明晰。本文中,我们研究了一种采用两层 ReLU 神经网络参数化的拟合 Q 迭代(Fitted Q-Iteration),并给出了该算法的样本复杂度保证。我们的方法在每次迭代中使用一个凸优化问题来估计 Q 函数。我们证明该方法达到了 \tilde{\mathcal{O}}(1/\epsilon^{2}) 的样本复杂度,这是阶最优的。该结果对可数状态空间成立,且不需要诸如 MDP 上具有线性或低秩结构之类的任何假设。
引用
@article{arxiv.2211.07675,
title = {On the Global Convergence of Fitted Q-Iteration with Two-layer Neural Network Parametrization},
author = {Mudit Gaur and Vaneet Aggarwal and Mridul Agarwal},
journal= {arXiv preprint arXiv:2211.07675},
year = {2023}
}