非均匀重放在强化学习中何时起作用?
机器学习
2026-05-19 v3 人工智能
摘要
现代无偏强化学习算法常依赖简单的均匀重放采样,然而何时何地需要非均匀重放仍不明确。我们在多样化的RL环境中展示,非均匀重放的有效性由三个因素决定:重放容量、每个环境步骤重放的转移数量、预期新鲜度——采样转移的新近程度,以及重放采样分布的熵。我们的主要贡献在于阐明何时非均匀重放是有益的,并为现代无偏RL中的重放设计提供实用指导。也就是说,我们发现当重放容量较低时,非均匀重放最为有益,且即便在相当的预期新鲜度下,高熵采样也至关重要。鼓励这些发现,我们采用一种简单的Truncated Geometric重放方法,该方法倾向于采样较新的经验,同时保持高熵并产生可忽略的计算开销。在大规模并行仿真、单任务和多任务设置中,包括三个在五个RL基准套件上评估的现代算法,该重放采样策略在低容量 regime 下提高了样本效率,而在高容量 regime 下仍保持竞争力。
引用
@article{arxiv.2605.10236,
title = {When Does Non-Uniform Replay Matter in Reinforcement Learning?},
author = {Michal Korniak and Mikołaj Czarnecki and Yarden As and Piotr Miłoś and Pieter Abbeel and Michal Nauman},
journal= {arXiv preprint arXiv:2605.10236},
year = {2026}
}