基于价值的深度强化学习的计算最优扩展
机器学习
2025-08-26 v2
摘要
随着模型规模增大且训练成本日益高昂,不仅要将训练方案扩展到更大的模型和更多的数据,而且要以计算最优的方式进行扩展,从而在单位计算量下获得最大性能,这一点变得愈发重要。虽然此类扩展在语言建模中已得到充分研究,但强化学习(RL)在这方面受到的关注较少。本文研究了在线、基于价值的深度强化学习的计算扩展。这些方法为计算资源分配提供了两个主要维度:模型容量和更新数据比(UTD)。在给定固定计算预算的情况下,我们探讨:应如何在这两个维度之间分配资源以最大化样本效率?我们的分析揭示了模型大小、批量大小和 UTD 之间微妙的相互作用。特别是,我们发现了一种我们称之为 TD 过拟合的现象:对于小模型,增加批量会迅速损害 Q 函数精度,但大模型不存在此效应,从而能够在大规模下有效利用大批量。我们提供了一个理解此现象的思维模型,并制定了选择批量大小和 UD 以优化计算使用的指南。我们的发现为深度强化学习中的计算最优扩展提供了一个扎实的起点,这类似于监督学习中的研究,但针对 TD 学习进行了调整。
引用
@article{arxiv.2508.14881,
title = {Compute-Optimal Scaling for Value-Based Deep RL},
author = {Preston Fu and Oleh Rybkin and Zhiyuan Zhou and Michal Nauman and Pieter Abbeel and Sergey Levine and Aviral Kumar},
journal= {arXiv preprint arXiv:2508.14881},
year = {2025}
}