中文

CUER:面向基于深度的连续强化学习算法的纠正均匀经验回放

机器学习 2024-06-14 v1 人工智能

摘要

经验回放机制的利用使智能体能够有效地多次利用其经验。在先前的研究中,基于转换的相对重要性修改经验回放中各转换的抽样概率。对每个迭代后重新为回放缓冲区中的每个转换重新分配抽样概率的过程被认为极其高效。因此,为了提高计算效率,经验回放优先级算法在抽样时重新评估转换的重要性。然而,随着智能体的策略和价值函数的迭代更新,转换的相对重要性会发生动态调整。此外,经验回放是一种保留由智能体过去策略生成的转换的机制,这些转换可能与智能体最新策略有显著差异。与智能体最新策略的增加性差异会导致更高频率的 off-policy 更新,这会对智能体的性能产生负面影响。本文我们发展了一种新算法,纠正均匀经验回放 (CUER),该算法在考虑到所有其他经验在抽样过程中的公平性,同时不忽略转换重要性的动态本质的情况下,对存储的经验进行随机抽样,以使抽样后的状态分布更贴近 on-policy。CUER 在采样效率、最终性能以及训练期间策略稳定性方面为基于连续控制的 off-policy 深度强化学习算法提供了有前景的改进。

关键词

引用

@article{arxiv.2406.09030,
  title  = {CUER: Corrected Uniform Experience Replay for Off-Policy Continuous Deep Reinforcement Learning Algorithms},
  author = {Arda Sarp Yenicesu and Furkan B. Mutlu and Suleyman S. Kozat and Ozgur S. Oguz},
  journal= {arXiv preprint arXiv:2406.09030},
  year   = {2024}
}