中文

面向连续控制的批量到流式深度强化学习

机器学习 2026-05-12 v2 人工智能

摘要

深度强化学习(RL)的方法在连续控制任务上取得了显著的性能,但其计算复杂度常常不适用于资源受限硬件,由于依赖回放缓冲区、批量更新和目标网络。流式深度 RL 新兴范式通过纯在线更新来解决这一限制,在标准基准测试上实现了强劲的实证性能。本文提出两种新颖的流式深度 RL 算法,Streaming Soft Actor-Critic(S2AC)和 Streaming Deterministic Actor-Critic(SDAC),专为与最先进的批量 RL 方法兼容而设计,特别适用于 Sim2Real 迁移等设备端微调应用。两种算法在标准基准测试上均达到与最先进流式基线相当的性能,且无需为每个环境进行繁琐的超参数调优。我们进一步研究了批量到流式的转换,表明盲目转换并不保证保持预训练策略的性能,我们提出了一种原则方法来解决这一挑战。

关键词

引用

@article{arxiv.2603.08588,
  title  = {Towards Batch-to-Streaming Deep Reinforcement Learning for Continuous Control},
  author = {Riccardo De Monte and Matteo Cederle and Gian Antonio Susto},
  journal= {arXiv preprint arXiv:2603.08588},
  year   = {2026}
}