用于悲观策略优化的裁剪目标策略梯度
机器学习
2023-11-13 v1
摘要
为促进高效学习,深度强化学习(RL)中的策略梯度方法通常与方差缩减措施及基于一批经验进行大而安全的策略变更的策略相配对。自然策略梯度方法,包括信赖域策略优化(TRPO),力求通过有界的策略输出变更产生单调改进。近端策略优化(PPO)是一种常用的一阶算法,其改用损失裁剪以每批数据执行多步安全优化,以对多步的正则化取代TRPO单步的边界。本工作中,我们发现PPO应用于连续动作空间时,可通过对目标的简单改动持续改良性能。我们推荐以等效方式裁剪的基础策略梯度,而非PPO的重要性采样目标。尽管两目标相对RL目标均产生有偏梯度估计,但相比无偏离策略策略梯度均显示显著方差缩减。此外,我们表明(1)裁剪目标策略梯度(COPG)目标平均而言较PPO目标“悲观”,且(2)此悲观性促进增强探索。结果,我们经实证观察到COPG在单任务、约束与多任务学习中较PPO产生改良学习,且不增加显著计算成本或复杂度。相比TRPO,COPG方法具可比或更优性能,同时保留一阶方法的简洁性。
引用
@article{arxiv.2311.05846,
title = {Clipped-Objective Policy Gradients for Pessimistic Policy Optimization},
author = {Jared Markowitz and Edward W. Staley},
journal= {arXiv preprint arXiv:2311.05846},
year = {2023}
}
备注
12 pages, 8 figures