中文

重新审视 Adam 在流式强化学习中的应用

机器学习 2026-05-11 v1 人工智能

摘要

从观察被感知并立即作出行动的序列中学习,而无需显式存储,为更简单、更高效和更自适应的算法提供了前景。然而,连续十年,深度强化学习都走了相反的道路,通过为智能体增添回放缓冲区或并行抽样例程,以努力驾驭学习不稳定性。最近,该主题被 Elsayed 等人 (2024) 重新审视,关注通过准格迹痕迹和对优化例程的修改来计算更新, resulting in StreamQ 算法。本文我们退一步,考察在此在线环境中采用既定更新(如 DQN 和 C51 实现的更新)的有效性。我们发现它们表现良好,通过分析优化算法一般情况下的工作方式,特别是 Adam 的工作方式,我们认为两个性质对于稳健性能至关重要:i) 目标的导数需要受限, ii) 权重更新需要根据方差进行调整。严格且详尽的实验表明,C51 具有上述两种特征,在 55 套 Atari 游戏中的一子集上与 StreamQ 竞争。基于这些见解,我们派生出一种基于准格迹痕迹的方差调整算法,称为 Adaptive Q (λ)(\lambda), 在同一子集上超越人类基准两倍,在所有性能指标上均优于现有方法。

关键词

引用

@article{arxiv.2605.06764,
  title  = {Revisiting Adam for Streaming Reinforcement Learning},
  author = {Florin Gogianu and Adrian Catalin Lutu and Razvan Pascanu},
  journal= {arXiv preprint arXiv:2605.06764},
  year   = {2026}
}