面向可扩展深度强化学习的球面归一化
机器学习
2025-05-30 v2
摘要
规模化模型规模和计算资源的提升在监督学习中常带来稳定的性能提升。然而,这一经验在强化学习(RL)中往往难以适用,因为在非平稳数据上训练模型容易导致过拟合和优化不稳定。为此,我们引入了 SimbaV2,这是一种新颖的 RL 架构,旨在通过 (i) 对权重和特征范数进行球面归一化来限制其增长;以及 (ii) 使用带奖励缩放的分布式价值估计,以维持在奖励幅度变化时的稳定梯度。在以软演员-评论家为基础算法的基础上,SimbaV2 能够有效地规模化, achieving state-of-the-art performance on 57 个连续控制任务中。代码已公开。
引用
@article{arxiv.2502.15280,
title = {Hyperspherical Normalization for Scalable Deep Reinforcement Learning},
author = {Hojoon Lee and Youngdo Lee and Takuma Seno and Donghu Kim and Peter Stone and Jaegul Choo},
journal= {arXiv preprint arXiv:2502.15280},
year = {2025}
}
备注
50 pages. ICML'25 (spotlight)