具有全局收敛保证的离屏强化学习坐标上升方法
机器学习
2022-12-13 v1
摘要
我们从坐标上升的角度重新审视强化学习(RL)中的离屏策略优化领域。一种常用方法是利用离屏策略梯度优化替代目标——即目标策略相对于行为策略状态分布的期望总折扣回报。然而,该方法已被证明存在分布失配问题,因此需要大量工作通过状态分布校正或反事实方法进行修正。本文中,我们通过坐标上升策略优化(CAPO)重新思考离屏学习,CAPO是一种离屏actor-critic算法,其在不使用策略梯度的情况下将策略改进与行为策略的状态分布解耦。该设计消除了离屏策略梯度策略改进步骤中分布校正或重要性采样的需求。我们建立了CAPO在一般坐标选择下的全局收敛性,并进一步量化了具有流行坐标选择规则(包括CAPO的循环与随机变体)的若干实例的收敛速率。随后我们将CAPO扩展至神经策略以实现更实际的实现。通过实验,我们证明CAPO在实践中提供了一种具有竞争力的RL方法。
引用
@article{arxiv.2212.05237,
title = {Coordinate Ascent for Off-Policy RL with Global Convergence Guarantees},
author = {Hsin-En Su and Yen-Ju Chen and Ping-Chun Hsieh and Xi Liu},
journal= {arXiv preprint arXiv:2212.05237},
year = {2022}
}
备注
47 pages, 4 figures