中文

无需批量更新、目标网络或回放缓冲区的深度策略梯度方法

机器学习 2025-05-22 v2 人工智能 机器人学 系统与控制 系统与控制

摘要

现代深度策略梯度方法在模拟机器人任务上实现了有效性能,但它们都需要大型回放缓冲区或昂贵的批量更新,或两者兼有,使得它们不适用于资源受限的实时系统。我们展示了这些方法在仅使用小型回放缓冲区或进行增量学习时(即仅使用最新样本进行更新,无需批量更新或回放缓冲区)会发生灾难性失败。我们提出了一种新颖的增量深度策略梯度方法——动作价值梯度(AVG),并提出一套归一化和缩放技术,以解决增量学习中不稳定性的挑战。在机器人模拟基准测试中,我们展示了AVG是唯一能够有效学习的增量方法,常常能够实现与批量策略梯度方法相当的最终性能。这一突破性进展使我们首次能够仅使用增量更新实现深度强化学习,分别使用机器人操作臂和移动机器人。

关键词

引用

@article{arxiv.2411.15370,
  title  = {Deep Policy Gradient Methods Without Batch Updates, Target Networks, or Replay Buffers},
  author = {Gautham Vasan and Mohamed Elsayed and Alireza Azimi and Jiamin He and Fahim Shariar and Colin Bellinger and Martha White and A. Rupam Mahmood},
  journal= {arXiv preprint arXiv:2411.15370},
  year   = {2025}
}

备注

In The Thirty-eighth Annual Conference on Neural Information Processing Systems. Source code at https://github.com/gauthamvasan/avg and companion video at https://youtu.be/cwwuN6Hyew0