中文

价值驱动深度强化学习可预测性放大

机器学习 2025-07-28 v2

摘要

规模化数据与计算资源是现代机器学习成功的关键,但规模化要求具备可预测性:我们希望方法不仅在计算或数据充足时表现良好,且能从小规模实验中预测大规模实验的性能。本文表明,价值驱动的离策略强化学习方法尽管社区传闻其行为异常,却具有可预测性。首先,我们证明达到特定性能水平所需的数据与计算资源 lie on 一个由更新-数据比率(UTD)控制的帕累托前沿。通过估计该前沿,可在给定更多计算资源时预测数据需求,或在给定更多数据时预测计算需求。其次,我们确定总资源预算在特定性能下的最优数据-计算分配,并据此确定最大化特定预算下性能的超参数。最后,此规模化依赖于首先估计超参数之间的可预测关系,用于管理离策略强化学习特有的过拟合与塑性损失。我们采用 SAC、BRO、PQL 三种算法,在 DeepMind Control、OpenAI Gym 与 IsaacGym 环境中验证方法,对数据、计算、预算或性能的提升进行外推验证。

关键词

引用

@article{arxiv.2502.04327,
  title  = {Value-Based Deep RL Scales Predictably},
  author = {Oleh Rybkin and Michal Nauman and Preston Fu and Charlie Snell and Pieter Abbeel and Sergey Levine and Aviral Kumar},
  journal= {arXiv preprint arXiv:2502.04327},
  year   = {2025}
}

备注

ICML 2025