中文

通过批量与权重归一化扩展基于批次的强化学习

机器学习 2025-05-23 v2 人工智能

摘要

强化学习取得了重要进展,但样本效率仍是现实应用中的瓶颈。最近,CrossQ 在保持低更新到数据比率(UTD)为1的同时,展示了领先的样本效率。本文探讨了在更高UTD比率下扩展CrossQ的行为。我们识别了随着UTD比率提高加剧的训练动力学挑战。为此,我们将权重归一化集成到CrossQ框架中,这一解决方案能够稳定训练,已被证明可防止塊性损失并保持有效学习率恒定。我们提出的方法可靠地随UTD比率的增加而扩展,在DeepMind Control Suite和Myosuite基准中的25个具有挑战性的连续控制任务中实现了具竞争力的性能,尤其是复杂的dog和humanoid环境。本工作消除了网络重置等激进干预的需求,为改进模型无监督强化学习的样本效率和可扩展性提供了简单而稳健的路径。

关键词

引用

@article{arxiv.2502.07523,
  title  = {Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization},
  author = {Daniel Palenicek and Florian Vogt and Joe Watson and Jan Peters},
  journal= {arXiv preprint arXiv:2502.07523},
  year   = {2025}
}