中文

低维流形上策略优化的神经策略镜像下降的样本复杂度

机器学习 2024-01-17 v2 机器学习

摘要

配备深度神经网络的策略梯度方法在解决高维强化学习(RL)问题中取得了巨大成功。然而,当前的分析无法解释为何它们能抵抗维数灾难。在本工作中,我们研究了使用深度卷积神经网络(CNN)的神经策略镜像下降(NPMD)算法的样本复杂度。受许多高维环境具有低维结构状态空间(例如以图像为状态)的经验观察启发,我们考虑状态空间为嵌入在 DD 维欧几里得空间中的 dd 维流形,其内在维度 dDd\ll D。我们表明,在 NPMD 的每次迭代中,值函数与策略均可被 CNN 良好逼近。逼近误差由网络规模控制,且先前网络的平滑性可被继承。因此,通过适当选择网络规模和超参数,NPMD 能以 O~(ϵdα2)\widetilde{O}(\epsilon^{-\frac{d}{\alpha}-2}) 的期望样本数找到 ϵ\epsilon-最优策略,其中 α(0,1]\alpha\in(0,1] 表示环境的平滑性。与先前工作相比,我们的结果表明 NPMD 可利用状态空间的低维结构来逃避维数灾难,从而解释了深度策略梯度算法的有效性。

关键词

引用

@article{arxiv.2309.13915,
  title  = {Sample Complexity of Neural Policy Mirror Descent for Policy Optimization on Low-Dimensional Manifolds},
  author = {Zhenghao Xu and Xiang Ji and Minshuo Chen and Mengdi Wang and Tuo Zhao},
  journal= {arXiv preprint arXiv:2309.13915},
  year   = {2024}
}