提升长尾强化学习环境学习效果的动量增强型时序记忆
机器学习
2025-04-09 v1 人工智能
摘要
传统强化学习 (RL) 算法假设数据分布为均匀或大多数情况下均匀。然而,这在大多数实际应用中如自动驾驶或自然界中动物活动中并不成立。一些经验会频繁遇到,而其余大多数经验则很少遇到; resulting distribution 被称为 Zipfian 分布。以互补学习系统理论为灵感,我们提出了一种用于学习 Zipfian 分布的架构,其中以无监督方式发现重要的长尾轨迹。该方案包括包含优先级记忆模块的时序记忆缓冲区,以确保重要的稀有轨迹被保留更长时间以解决 Zipfian问题,这需要以高效的方式进行信用分配。随后,从时序记忆中恢复经验并赋予加权重要性,形成要执行的轨迹。值得注意的是,所提出的架构是模块化的,可整合到任何 RL 架构中,并在多个 Zipfian 任务上 outperform 传统架构。我们的方法在所有三个任务和三个评估指标 (Zipfian、Uniform 和 Rare Accuracy) 上均显著优于 IMPALA,并在大多数被认为具有挑战性的 Atari 环境中也获得改进。
引用
@article{arxiv.2504.05840,
title = {Momentum Boosted Episodic Memory for Improving Learning in Long-Tailed RL Environments},
author = {Dolton Fernandes and Pramod Kaushik and Harsh Shukla and Bapi Raju Surampudi},
journal= {arXiv preprint arXiv:2504.05840},
year = {2025}
}