递归无策略深度强化学习无需变慢
机器学习
2025-12-24 v1
摘要
递归无策略深度强化学习模型在取得最新性能成果的同时,常因其高计算需求而被边缘化。为此,我们提出了 RISE(Recurrent Integration via Simplified Encodings,递归集成简化编码)方法,能够在无显著计算开销的情况下,将递归网络应用于任何基于图像的无策略 RL 设置,方法通过使用可学习和非可学习编码器层。将 RISE 集成到领先的非递归无策略 RL 算法中后,我们观察到在 Atari 基准测试中实现了 35.6%的人类归一化四分位均值(IQM)性能提升。我们分析了各种实现策略,以凸显所提出框架的灵活性和潜力。
引用
@article{arxiv.2512.20513,
title = {Recurrent Off-Policy Deep Reinforcement Learning Doesn't Have to be Slow},
author = {Tyler Clark and Christine Evers and Jonathon Hare},
journal= {arXiv preprint arXiv:2512.20513},
year = {2025}
}