中文

通过批量优先经验回放对深度确定性策略梯度算法的离策略校正

机器学习 2021-11-15 v2 人工智能

摘要

经验回放机制允许智能体多次使用经验。在先前的工作中,转移的采样概率根据其重要性进行调整。在每次迭代后为回放缓冲区中的每个转移重新分配采样概率效率极低。因此,经验回放优先级算法在相应转移被采样时重新计算其重要性,以获得计算效率。然而,随着智能体策略和价值函数的更新,转移的重要性水平会动态变化。此外,经验回放存储的转移由智能体先前的策略生成,这些策略可能显著偏离智能体的最新策略。与智能体最新策略的偏差越大,导致越多的离策略更新,这对智能体是有害的。在本文中,我们开发了一种新颖的算法——基于 KL 散度的批量优先经验回放(KLPER),该算法优先处理批量转移,而不是直接对每个转移进行优先级排序。此外,为减少更新的离策略性,我们的算法从一定数量的批次中选择一个批次,并强制智能体通过最可能由智能体最新策略生成的批次进行学习。我们将该算法与深度确定性策略梯度和双延迟深度确定性策略梯度相结合,并在各种连续控制任务上对其进行评估。KLPER 在样本效率、最终性能和训练期间策略的稳定性方面,为深度确定性连续控制算法提供了有前景的改进。

关键词

引用

@article{arxiv.2111.01865,
  title  = {Off-Policy Correction for Deep Deterministic Policy Gradient Algorithms via Batch Prioritized Experience Replay},
  author = {Dogan C. Cicek and Enes Duran and Baturay Saglam and Furkan B. Mutlu and Suleyman S. Kozat},
  journal= {arXiv preprint arXiv:2111.01865},
  year   = {2021}
}

备注

Accepted at The 33rd IEEE International Conference on Tools with Artificial Intelligence (ICTAI 2021)