强化学习中的归一化与有效学习率
机器学习
2024-07-03 v1 人工智能
摘要
归一化层近期在深度强化学习与持续学习文献中复潮,多个研究指出其多种益处,如改善损失景观条件、抑制高估偏差。然而,归一化带来了一个微妙但重要的副作用:网络参数范数增长与有效学习率衰减之间存在等价性。这在持续学习场景中尤为问题,因为有效学习率计划可能衰减至接近零的速度超过学习问题的尺度。我们提出通过简单 re-parameterization 实现显式学习率计划,称为 Normalize-and-Project(NaP),将归一化层的插入与权重投影耦合,确保有效学习率在训练期间保持恒定。该技术本身也是强大分析工具,帮助更好地理解深度强化学习中学习率计划,并提升对合成塑性损失基准(包括单任务与顺序变体的 Arcade Learning Environment)非平稳性的鲁棒性。我们还展示,该方法可轻松应用于诸如 ResNet 与 transformer 等流行架构,同时在常见 stationary 基准中恢复甚至在某些情况下略微提升基线模型性能。
引用
@article{arxiv.2407.01800,
title = {Normalization and effective learning rates in reinforcement learning},
author = {Clare Lyle and Zeyu Zheng and Khimya Khetarpal and James Martens and Hado van Hasselt and Razvan Pascanu and Will Dabney},
journal= {arXiv preprint arXiv:2407.01800},
year = {2024}
}