中文

SimBa:用于深化强化学习参数扩展的简单性偏置

机器学习 2025-05-30 v2 人工智能

摘要

近期CV和NLP的进展主要来自网络参数的扩大,尽管传统理论表明更大的网络容易过拟合。这些大型网络通过整合可引导模型向简单且可泛化解决方案发挥作用的组件来避免过拟合。然而,在深度强化学习中,设计和扩大网络的工作较少探索。受此机遇启发,我们提出SimBa,通过注入简单性偏见来扩大深度强化学习中的参数。SimBa包含三个组件:(i)一个观察标准化层,用于基于运行统计数据对输入进行标准化;(ii)一个残差前馈块,提供从输入到输出的线性通道;(iii)层归一化以控制特征幅度。通过SimBa扩大参数,可持续提高各种深度强化学习算法的样本效率,包括离策略、在策略和无监督方法。此外,仅通过将SimBa架构集成到SAC中,就能在DMC、MyoSuite和HumanoidBench上实现高计算效率,匹配或超越当前最先进的深度强化学习方法。这些结果表明SimBa在多样化的RL算法和环境中具有广泛的适用性和有效性。

关键词

引用

@article{arxiv.2410.09754,
  title  = {SimBa: Simplicity Bias for Scaling Up Parameters in Deep Reinforcement Learning},
  author = {Hojoon Lee and Dongyoon Hwang and Donghu Kim and Hyunseung Kim and Jun Jet Tai and Kaushik Subramanian and Peter R. Wurman and Jaegul Choo and Peter Stone and Takuma Seno},
  journal= {arXiv preprint arXiv:2410.09754},
  year   = {2025}
}

备注

ICLR'25 (spotlight)