中文

平均 $n$ 步回报降低强化学习中的方差

机器学习 2025-12-23 v4

摘要

多步回报,如 nn 步回报和 λ\lambda 回报,通常用于提高强化学习(RL)方法的样本效率。多步回报的方差成为其长度的限制因素;展望未来太远会增加方差并逆转多步学习的收益。在我们的工作中,我们展示了复合回报(compound returns)——nn 步回报的加权平均——降低方差的能力。我们首次证明,任何与给定 nn 步回报具有相同收缩模量的复合回报都具有严格更低的方差。我们还证明,这种方差降低特性在线性函数逼近下改善了时序差分学习的有限样本复杂度。由于通用复合回报的实现可能代价高昂,我们引入了双自举回报(two-bootstrap returns),它在保持高效的同时降低了方差,即使在使用小批量经验回放时也是如此。我们进行的实验表明,复合回报通常能提高 nn 步深度RL智能体(如DQN和PPO)的样本效率。

关键词

引用

@article{arxiv.2402.03903,
  title  = {Averaging $n$-step Returns Reduces Variance in Reinforcement Learning},
  author = {Brett Daley and Martha White and Marlos C. Machado},
  journal= {arXiv preprint arXiv:2402.03903},
  year   = {2025}
}

备注

ICML 2024. 27 pages, 7 figures, 3 tables. Fixed minor equation typos