中文

单智能体强化学习的缩放定律

机器学习 2023-02-21 v2 人工智能 机器学习

摘要

近期研究表明,在生成式建模中,交叉熵损失随模型规模与训练计算量平滑提升,遵循幂律加常数的缩放定律。将此类结果扩展至强化学习的一大挑战在于,主要关注性能目标即平均回合回报未必平滑变化。为克服该问题,我们引入*内在性能*,它是回报的单调函数,定义为在不同规模模型族中达到给定回报所需的最小计算量。我们发现,在一系列环境中,内在性能随模型规模与环境交互次数呈幂律缩放。因此,如同生成式建模,最优模型规模随训练计算预算呈幂律缩放。此外,我们研究了该关系如何随环境及训练设置的其他属性变化。特别地,使用一个基于 MNIST 的玩具环境,我们展示了改变任务的“视野长度”主要改变该关系的系数而非指数。

关键词

引用

@article{arxiv.2301.13442,
  title  = {Scaling laws for single-agent reinforcement learning},
  author = {Jacob Hilton and Jie Tang and John Schulman},
  journal= {arXiv preprint arXiv:2301.13442},
  year   = {2023}
}

备注

33 pages