流式深度强化学习终于可用了
机器学习
2024-12-09 v2 人工智能
摘要
自然智能以连续流的方式处理经验,在现实时间中感知、行动与学习。流式学习是经典强化学习算法(如 Q 学习和 TD 方法)的常规操作方式,通过使用最新的样本而不存储样本来模拟自然学习。这种方法也适用于资源受限、通信受限和隐私敏感的应用。然而,在深度强化学习中,学习者几乎总是使用批量更新和回放缓冲区,这使得它们计算昂贵且不兼容流式学习。尽管批量深度强化学习的流行常被归因于其样本效率,但更关键的原因是流式深度强化学习的频繁不稳定和学习失败,被称为流屏障。本文引入了 stream-x 算法,这是一类首次克服预测和控制领域的流屏障的深度强化学习算法,匹配批量强化学习的样本效率。通过在 Mujoco Gym、DM Control Suite 和 Atari 游戏中的实验,我们展示了现有算法中的流屏障,并成功实现了 stream-x 算法(stream Q、stream AC 和 stream TD)的稳定学习:在 DM Control Dog 环境中实现了最佳无模型性能。一组常见技术构成了 stream-x 算法的基础,使其能够通过单一参数集实现成功,并允许轻松扩展到其他算法,从而复兴了流式强化学习。
引用
@article{arxiv.2410.14606,
title = {Streaming Deep Reinforcement Learning Finally Works},
author = {Mohamed Elsayed and Gautham Vasan and A. Rupam Mahmood},
journal= {arXiv preprint arXiv:2410.14606},
year = {2024}
}