中文

递归无策略深度强化学习无需变慢

机器学习 2025-12-24 v1

摘要

递归无策略深度强化学习模型在取得最新性能成果的同时,常因其高计算需求而被边缘化。为此,我们提出了 RISE(Recurrent Integration via Simplified Encodings,递归集成简化编码)方法,能够在无显著计算开销的情况下,将递归网络应用于任何基于图像的无策略 RL 设置,方法通过使用可学习和非可学习编码器层。将 RISE 集成到领先的非递归无策略 RL 算法中后,我们观察到在 Atari 基准测试中实现了 35.6%的人类归一化四分位均值(IQM)性能提升。我们分析了各种实现策略,以凸显所提出框架的灵活性和潜力。

关键词

引用

@article{arxiv.2512.20513,
  title  = {Recurrent Off-Policy Deep Reinforcement Learning Doesn't Have to be Slow},
  author = {Tyler Clark and Christine Evers and Jonathon Hare},
  journal= {arXiv preprint arXiv:2512.20513},
  year   = {2025}
}