一种具有通用参数化与线性收敛的策略镜像下降新框架
机器学习
2024-02-14 v4 机器学习
最优化与控制
统计理论
统计理论
摘要
强化学习中的现代策略优化方法,如 TRPO 与 PPO,其成功归功于参数化策略的使用。然而,尽管此类算法已在理论上(尤其在表格情形下)获得保证,通用参数化方案的使用在很大程度上仍缺乏依据。本工作中,我们引入一种基于镜像下降的策略优化新框架,其天然兼容通用参数化。我们的方案所诱导的策略类可恢复已知类(如 softmax),并依镜像映射的选择生成新类。利用该框架,我们获得了首个保证涉及通用参数化的策略梯度类方法线性收敛的结果。为展示该框架兼容通用参数化方案的能力,我们给出了其使用浅层神经网络时的样本复杂度,表明其较先前最优结果有所改进,并在经典控制任务上经实证验证了理论主张的有效性。
引用
@article{arxiv.2301.13139,
title = {A Novel Framework for Policy Mirror Descent with General Parameterization and Linear Convergence},
author = {Carlo Alfano and Rui Yuan and Patrick Rebeschini},
journal= {arXiv preprint arXiv:2301.13139},
year = {2024}
}
备注
Post-conference updates