中文

Offline-Boosted Actor-Critic: 适应性地在深度离线策略 RL 中融合最优历史行为

机器学习 2024-05-30 v1 人工智能

摘要

离线策略强化学习 (RL) 通过利用之前收集的数据来进行策略学习,已在解决许多复杂现实任务方面取得了显著的成功。然而,大多数现有的离线策略 RL 算法未能充分利用回放缓冲区中的信息,限制了样本效率和策略性能。在本工作中,我们发现,基于共享在线回放缓冲区进行离线 RL 策略的并行训练有时会超过原始在线学习策略,尽管这种性能提升的发生仍然是不可确定的。这激发了一种新的可能性,即利用涌现出的超越离线最优策略来改进在线策略学习。基于这一洞见,我们提出了 Offline-Boosted Actor-Critic (OBAC),这是一种无模型的在线 RL 框架,通过价值比较优雅地识别超越的离线策略,并将其用作自适应约束,以保证更强的策略学习性能。我们的实验表明,OBAC 在 53 个跨越 6 个任务套组的任务上均优于其他流行的无模型 RL 基线方法,并在样本效率和渐近性能方面与先进的基于模型的 RL 方法不相上下。

关键词

引用

@article{arxiv.2405.18520,
  title  = {Offline-Boosted Actor-Critic: Adaptively Blending Optimal Historical Behaviors in Deep Off-Policy RL},
  author = {Yu Luo and Tianying Ji and Fuchun Sun and Jianwei Zhang and Huazhe Xu and Xianyuan Zhan},
  journal= {arXiv preprint arXiv:2405.18520},
  year   = {2024}
}