中文

理解每步回放量变化的影响

机器学习 2023-02-22 v1 人工智能

摘要

基于模型的强化学习利用模型进行规划,其中智能体的预测与策略可通过使用更多计算而非来自环境的额外数据来改进,从而提高样本效率。然而,学习准确的模型估计是困难的。随之而来的自然问题是,我们能否从无模型方法中获得类似于规划的好处。经验回放是许多无模型算法的重要组成部分,其通过提供存储过往经验以在梯度计算过程中进一步复用的机制,实现了样本高效学习与稳定性。先前工作通过将后者用于规划,建立了模型与经验回放之间的联系。这涉及增加每步采样小批量并用于更新的次数(每步回放量)。我们尝试利用该联系,在知名无模型算法Deep Q-Network(DQN)于Mountain Car环境中,对每步回放量变化的影响进行系统研究。我们经实验表明,增加回放可改善DQN的样本效率、降低其性能变异,并使其对超参数变化更具鲁棒性。总体而言,这朝更好的部署算法迈出了一步。

关键词

引用

@article{arxiv.2302.10311,
  title  = {Understanding the effect of varying amounts of replay per step},
  author = {Animesh Kumar Paul and Videh Raj Nema},
  journal= {arXiv preprint arXiv:2302.10311},
  year   = {2023}
}

备注

10 Pages, 4 figures