中文

反向经验回放的更紧收敛性证明

机器学习 2024-09-02 v1 机器学习

摘要

在强化学习中,反向经验回放(RER)是一种最近提出的算法,其样本复杂度优于经典经验回放方法。RER 要求学习算法以逆序通过连续的状态-动作-奖励元组更新参数。然而,最近的理论分析仅适用于极小的学习率和较短的连续步长,其收敛速度慢于不使用 RER 的大学习率算法。鉴于这一理论与经验上的差距,我们提供了一种更紧的分析,减轻了对学习率和连续步长的限制。此外,我们从理论上证明了 RER 在更大学习率和更长序列下能够收敛。

关键词

引用

@article{arxiv.2408.16999,
  title  = {A Tighter Convergence Proof of Reverse Experience Replay},
  author = {Nan Jiang and Jinzhao Li and Yexiang Xue},
  journal= {arXiv preprint arXiv:2408.16999},
  year   = {2024}
}

备注

This paper is accepted at RLC 2024