AdaMemento:基于自适应记忆辅助的强化学习策略优化
机器学习
2026-05-28 v2
摘要
在稀疏奖励的强化学习(RL)场景中,记忆机制通过反思过去经验(如人类般)为策略优化提供了有前景的shortcut。然而,当前的记忆-based RL方法仅存储和重用高价值策略,缺乏对多样化过去经验的深入细化和筛选,限制了记忆的能力。本文提出AdaMemento—an自适应记忆增强的RL框架。我们设计的记忆反思模块利用正负经验,通过学习基于实时状态预测已知局部最优策略。为有效收集记忆中有信息的轨迹,我们进一步引入细粒度内在动机范式,使相似状态的细微差别能够被精确辨识,以指导探索。记忆经验的利用与新策略的探索随后通过集成学习自适应协调,以接近全局最优。我们在理论上证明了新型内在动机和集成机制的优越性。通过59项定量和可视化实验,我们确认AdaMemento能够为更好的探索辨别细微状态,并有效利用记忆中的过去经验,相较于先前方法实现了显著改进。
引用
@article{arxiv.2410.04498,
title = {AdaMemento: Adaptive Memory-Assisted Policy Optimization for Reinforcement Learning},
author = {Renye Yan and Yaozhong Gan and You Wu and Junliang Xing and Ling Liangn and Yeshang Zhu and Yimao Cai},
journal= {arXiv preprint arXiv:2410.04498},
year = {2026}
}