低维流形上策略优化的神经策略镜像下降的样本复杂度
机器学习
2024-01-17 v2 机器学习
摘要
配备深度神经网络的策略梯度方法在解决高维强化学习(RL)问题中取得了巨大成功。然而,当前的分析无法解释为何它们能抵抗维数灾难。在本工作中,我们研究了使用深度卷积神经网络(CNN)的神经策略镜像下降(NPMD)算法的样本复杂度。受许多高维环境具有低维结构状态空间(例如以图像为状态)的经验观察启发,我们考虑状态空间为嵌入在 维欧几里得空间中的 维流形,其内在维度 。我们表明,在 NPMD 的每次迭代中,值函数与策略均可被 CNN 良好逼近。逼近误差由网络规模控制,且先前网络的平滑性可被继承。因此,通过适当选择网络规模和超参数,NPMD 能以 的期望样本数找到 -最优策略,其中 表示环境的平滑性。与先前工作相比,我们的结果表明 NPMD 可利用状态空间的低维结构来逃避维数灾难,从而解释了深度策略梯度算法的有效性。
引用
@article{arxiv.2309.13915,
title = {Sample Complexity of Neural Policy Mirror Descent for Policy Optimization on Low-Dimensional Manifolds},
author = {Zhenghao Xu and Xiang Ji and Minshuo Chen and Mengdi Wang and Tuo Zhao},
journal= {arXiv preprint arXiv:2309.13915},
year = {2024}
}