权归一化下的 CrossQ 扩展
机器学习
2025-06-05 v1 人工智能
摘要
强化学习取得了诸多突破,但样本效率仍是实际应用的瓶颈。最近,CrossQ 以极低的更新到数据比率 (UTD) 达到 1 实现了最先进的样本效率。本文探讨了 CrossQ 在更高 UTD 比率下的扩展行为。我们识别出训练动力学中的挑战,这些挑战在更高的 UTD 下被放大,特别是 Q 偏差爆炸和批判网络权重 magnitude 的增长。为解决此问题,我们将权重归一化集成到 CrossQ 框架中,该方法稳定了训练,防止潜在的塌缩,并保持有效学习率恒定。我们提出的方法可靠地随着 UTD 比率的提升而扩展,在 DeepMind 控制基准测试中的多个具有挑战性的任务上实现了具竞争力或更优的性能,尤其是复杂的 dog 和 humanoid 环境。该工作消除了需要网络重置等激进干预的需求,为改进模型无监督强化学习的样本效率和可扩展性提供了稳健的路径。
引用
@article{arxiv.2506.03758,
title = {Scaling CrossQ with Weight Normalization},
author = {Daniel Palenicek and Florian Vogt and Jan Peters},
journal= {arXiv preprint arXiv:2506.03758},
year = {2025}
}
备注
arXiv admin note: substantial text overlap with arXiv:2502.07523