块策略镜像下降
机器学习
2022-09-20 v3 人工智能
最优化与控制
摘要
本文提出一种新的策略梯度(PG)方法,即块策略镜像下降(BPMD)方法,用于求解一类带有(强)凸正则化项的正则化强化学习(RL)问题。相较于访问并更新每个状态的策略的传统批更新规则 PG 方法,BPMD 方法通过部分更新规则(在采样状态上执行策略更新)具有低廉的每轮迭代计算成本。尽管问题具有非凸性质且采用部分更新规则,我们为若干采样方案提供了统一分析,并证明 BPMD 可实现到全局最优性的快速线性收敛。特别地,均匀采样导致的最坏情况总计算复杂度与批 PG 方法相当。我们还给出了同策略采样收敛的充要条件。借助混合采样方案,我们进一步表明 BPMD 享有潜在的实例相关加速,从而改善对状态空间的依赖,进而优于批 PG 方法。随后我们将 BPMD 方法扩展到随机设定,利用由样本构造的随机一阶信息。在生成模型下,针对强凸(对应非强凸)正则化项,建立了 (相应为 )的样本复杂度,其中 表示目标精度。据我们所知,这是首次在强化学习的策略优化中开发并分析块坐标下降方法,为求解大规模 RL 问题提供了新视角。
引用
@article{arxiv.2201.05756,
title = {Block Policy Mirror Descent},
author = {Guanghui Lan and Yan Li and Tuo Zhao},
journal= {arXiv preprint arXiv:2201.05756},
year = {2022}
}