Off-OAB:基于最优动作相关基准的离策略策略梯度方法
机器学习
2024-05-07 v1 人工智能
摘要
基于策略的方法在解决具有挑战性的强化学习问题方面取得了显著的成功。在这些方法中,离策略策略梯度方法尤为重要,因为它们能够从离策略数据中受益。然而,这些方法会因离策略策略梯度(OPPG)估计器的高方差而受到制约,导致训练期间的样本效率较差。本文提出一种基于最优动作相关基准(Off-OAB)的离策略策略梯度方法,以缓解此方差问题。具体而言,该基准在保持OPPG估计器无偏性的同时,理论上最小化其方差。为提高实际计算效率,我们设计了该最优基准的一个近似版本。借助该近似方法,Off-OAB旨在策略优化期间降低OPPG估计器的方差。我们在来自OpenAI Gym和MuJoCo的六个代表性任务上评估了所提Off-OAB方法,其中在大多数任务上均显著优于最先进的方法。
引用
@article{arxiv.2405.02572,
title = {Off-OAB: Off-Policy Policy Gradient Method with Optimal Action-Dependent Baseline},
author = {Wenjia Meng and Qian Zheng and Long Yang and Yilong Yin and Gang Pan},
journal= {arXiv preprint arXiv:2405.02572},
year = {2024}
}
备注
12 pages, 3 figures