中文

行动者优先经验回放

机器学习 2022-09-02 v1 人工智能

摘要

一种被广泛研究的深度强化学习(RL)技术——优先经验回放(PER)允许智能体以与其时序差分(TD)误差成正比的非均匀概率对转移进行采样学习。尽管已表明PER是离散动作域中深度RL方法整体性能的最关键组件之一,许多实证研究指出其在连续控制中明显逊于actor-critic算法。我们从理论上证明,actor网络无法用具有大TD误差的转移进行有效训练。结果,在Q网络下计算的近似策略梯度偏离了在最优Q函数下计算的实际梯度。受此启发,我们为actor-critic方法引入了一种新的经验回放采样框架,该框架也考虑了稳定性问题以及近期关于PER较差实证表现背后的发现。所引入的算法提出了PER的新改进分支,并为actor和critic网络安排了有效且高效的训练。大量实验验证了我们的理论主张,并表明所引入的方法显著优于对比方法,且在标准离策略actor-critic算法上取得了最先进的结果。

关键词

引用

@article{arxiv.2209.00532,
  title  = {Actor Prioritized Experience Replay},
  author = {Baturay Saglam and Furkan B. Mutlu and Dogan C. Cicek and Suleyman S. Kozat},
  journal= {arXiv preprint arXiv:2209.00532},
  year   = {2022}
}

备注

21 pages, 5 figures, 4 tables