降低复杂问题中深度强化学习方差的长N步替代阶段奖励
机器学习
2024-03-21 v1
摘要
强化学习中的高方差已被证明会阻碍成功收敛并损害任务性能。由于奖励信号在学习行为中起重要作用,多步方法被认为可缓解该问题,且比单步方法更有效。然而,缺乏对此重要方面的全面系统研究,以证明多步方法在解决高度复杂连续控制问题上的有效性。本研究提出一种新的长步替代阶段(LNSS)奖励方法,可有效应对复杂环境动态,而先前方法通常仅适用于有限步数。LNSS方法简单、计算成本低,适用于基于值或策略梯度的强化学习。我们在OpenAI Gym和DeepMind Control Suite中系统评估LNSS,以解决一些通常难以通过DRL取得好结果的复杂基准环境。我们展示了LNSS在总奖励、收敛速度和变异系数(CV)方面的性能提升。我们还从分析上阐释了LNSS如何指数级降低相应单步方法的Q值方差上界。
引用
@article{arxiv.2210.04820,
title = {Long N-step Surrogate Stage Reward to Reduce Variances of Deep Reinforcement Learning in Complex Problems},
author = {Junmin Zhong and Ruofan Wu and Jennie Si},
journal= {arXiv preprint arXiv:2210.04820},
year = {2024}
}