论想象中的训练
机器学习
2026-05-13 v2
摘要
最先进的基于模型的强化学习方法在想象的 rollout 上训练策略。这些 rollout 是由学习到的动力学模型生成并由学习到的奖励模型评分的轨迹,但在策略更新期间不查询真实环境。我们通过量化学习到的动力学和奖励模型中的误差如何影响回报和策略优化来研究这一训练范式。首先,我们将 Asadi 等人 (2018) 的分析扩展到具有学习奖励模型的 MDP,并推导出最优样本分配——在幂律缩放假设下最小化回报误差界限的动力学样本与奖励样本之比。我们将学习到的动力学、奖励和策略的下 Lipschitz 常数确定为收紧此界限的表示要求,并将此视角与 Wang 等人 (2026) 的时间拉直目标联系起来。其次,我们研究了使用 REINFORCE 的策略优化如何容忍通常获取成本更低的噪声奖励。我们证明,零均值奖励噪声使梯度估计器保持无偏,并最多增加一个随 rollout 数量增加而减小的方差项。这引入了一个实际的权衡:在给定固定预算的情况下,应该购买更多具有更便宜但更嘈杂奖励的 rollout,还是更少具有更昂贵但噪声更小奖励的 rollout?我们将这一选择简化为一维优化问题并刻画了最优解。
引用
@article{arxiv.2605.06732,
title = {On Training in Imagination},
author = {Nadav Timor and Ravid Shwartz-Ziv and Micah Goldblum and Yann LeCun and David Harel},
journal= {arXiv preprint arXiv:2605.06732},
year = {2026}
}