中文

AdaMemento:基于自适应记忆辅助的强化学习策略优化

机器学习 2026-05-28 v2

摘要

在稀疏奖励的强化学习(RL)场景中,记忆机制通过反思过去经验(如人类般)为策略优化提供了有前景的shortcut。然而,当前的记忆-based RL方法仅存储和重用高价值策略,缺乏对多样化过去经验的深入细化和筛选,限制了记忆的能力。本文提出AdaMemento—an自适应记忆增强的RL框架。我们设计的记忆反思模块利用正负经验,通过学习基于实时状态预测已知局部最优策略。为有效收集记忆中有信息的轨迹,我们进一步引入细粒度内在动机范式,使相似状态的细微差别能够被精确辨识,以指导探索。记忆经验的利用与新策略的探索随后通过集成学习自适应协调,以接近全局最优。我们在理论上证明了新型内在动机和集成机制的优越性。通过59项定量和可视化实验,我们确认AdaMemento能够为更好的探索辨别细微状态,并有效利用记忆中的过去经验,相较于先前方法实现了显著改进。

关键词

引用

@article{arxiv.2410.04498,
  title  = {AdaMemento: Adaptive Memory-Assisted Policy Optimization for Reinforcement Learning},
  author = {Renye Yan and Yaozhong Gan and You Wu and Junliang Xing and Ling Liangn and Yeshang Zhu and Yimao Cai},
  journal= {arXiv preprint arXiv:2410.04498},
  year   = {2026}
}