SPEQ:面向高更新-数据比比的强化学习的离线稳定阶段
机器学习
2025-03-19 v2 人工智能
摘要
高更新-数据比(UTD)比算法在强化学习(RL)中提高了样本效率,但带来了高计算成本,限制了其在实际场景中的可扩展性。我们提出一种名为Offline Stabilization Phases for Efficient Q-Learning (SPEQ)的强化学习算法,将低UTD比的在线训练与周期性离线稳定阶段相结合。在这些稳定阶段中,对Q函数在固定回放缓冲区上以高UTD比进行微调,减少对次优数据的冗余更新。这种结构化的训练计划在计算效率和样本效率之间实现了最佳平衡,解决了当前高UTD和低UTD方法方法的局限性。我们在MuJoCo连续控制基准测试中经验性地表明,SPEQ所需的梯度更新次数减少40%至99%,训练时间缩短27%至78%,且在保持或超越当前最先进方法性能方面表现良好。我们的发现凸显了周期性稳定阶段作为传统训练计划的有效替代方案的潜力,为在计算资源受限的实际应用场景中实现更可扩展的强化学习解决方案铺平了道路。
引用
@article{arxiv.2501.08669,
title = {SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning},
author = {Carlo Romeo and Girolamo Macaluso and Alessandro Sestini and Andrew D. Bagdanov},
journal= {arXiv preprint arXiv:2501.08669},
year = {2025}
}