高效的基于特定上下文编码器学习率的循环无策略 RL
机器学习
2024-05-27 v1
摘要
现实世界的决策任务通常属于部分可观测马尔可夫决策过程 (POMDP),其中状态无法完全观测。最近的进展表明,基于循环神经网络 (RNN) 进行上下文编码以预测不可观测状态、基于多层感知器 (MLP) 进行决策的循环强化学习 (RL) 能够缓解部分可观测性问题,并为 POMDP 任务提供稳健的基线。然而,现有的循环 RL 方法因 RNN 的梯度不稳定性而面临训练稳定性问题。本文提出了循环无策略 RL with Context-Encoder-Specific Learning Rate (RESeL) 以解决此问题。具体而言,RESeL 为上下文编码器采用较低的学习率,而保留其他 MLP 层的训练效率,从而确保前者的稳定性。我们将该技术集成到现有的无策略 RL 方法中,得到 RESeL 算法。我们在 18 个 POMDP 任务上进行评估,包括经典任务、元 RL 任务和信用分配场景,以及 5 个 MDP locomotion 任务。实验表明,RESeL 在训练稳定性方面显著优于先前方法。比较结果显示,RESeL 在 POMDP 任务中超越了以前的循环 RL 基线,实现显著性能提升;在 MDP 任务中,则与最新方法持平甚至更优。进一步的消融研究强调了为上下文编码器应用不同学习率的必要性。
关键词
引用
@article{arxiv.2405.15384,
title = {Efficient Recurrent Off-Policy RL Requires a Context-Encoder-Specific Learning Rate},
author = {Fan-Ming Luo and Zuolin Tu and Zefang Huang and Yang Yu},
journal= {arXiv preprint arXiv:2405.15384},
year = {2024}
}