中文

探究优先级回放与泛化之间的相互作用

机器学习 2024-10-22 v2 人工智能

摘要

经验回放是指重复使用过去的数据以提高样本效率的技术,在强化学习中广为流行。尽管已引入各种智能抽样方案以提升性能,但统一抽样至今仍是最常用的做法。唯一的例外是优先级经验回放(Prioritized Experience Replay, PER),其抽样方式依据 TD 误差按比例进行,灵感来自动态编程中优先级扫荡的成功。早期的 PER 研究在 Atari 上的表现显示出改进,但后续研究结果呈现出参差不齐的现象。本文我们检讨了 PER 的若干变体,以尝试理解 PER 在何处以及何时可能有用。我们的发现表明,在预测任务中,虽然 PER 可改善表格环境下的值传播,但当与神经网络结合时,行为会显著不同。某些缓解措施——例如延迟目标网络更新以控制泛化,以及使用 PER 中预期 TD 误差的估计值以避免追逐随机性——可避免 PER 与神经网络导致的大幅误差波动,但总体上并不显著优于统一回放。在控制任务中,NONE 的优先级变体都无法稳健地超越统一回放。我们提出了对优先级、引导和神经网络之间相互作用的新见解,并为表格环境和噪声域中的 PER 提出了若干改进方案。

关键词

引用

@article{arxiv.2407.09702,
  title  = {Investigating the Interplay of Prioritized Replay and Generalization},
  author = {Parham Mohammad Panahi and Andrew Patterson and Martha White and Adam White},
  journal= {arXiv preprint arXiv:2407.09702},
  year   = {2024}
}

备注

Published in the Reinforcement Learning Conference 2024