用于基于记忆的连续控制的循环离策略基线方法
机器学习
2021-10-28 v1 人工智能
机器人学
摘要
当环境部分可观测(PO)时,深度强化学习(RL)智能体除了必须学习控制策略外,还必须学习整个历史合适的时序表示。该问题并不新颖,并且已有针对该问题的无模型和有模型算法被提出。然而,受近期无模型基于图像的 RL 成功的启发,我们注意到缺乏一种用于基于历史的 RL 的无模型基线,该基线(1)使用完整历史且(2)结合了近期离策略连续控制中的进展。因此,我们在本工作中实现了 DDPG、TD3 和 SAC 的循环版本(RDPG、RTD3 和 RSAC),在短期和长期 PO 领域上评估它们,并研究关键设计选择。我们的实验表明 RDPG 和 RTD3 在某些领域可能意外失败,而 RSAC 最为可靠,在几乎所有领域都达到了近最优性能。然而,一个需要系统性探索的任务即使对 RSAC 也仍很困难。这些结果表明无模型 RL 可以仅使用奖励信号学习良好的时序表示;主要困难似乎是计算成本和探索。为促进未来研究,我们已将 PyTorch 实现公开于 https://github.com/zhihanyang2022/off-policy-continuous-control。
引用
@article{arxiv.2110.12628,
title = {Recurrent Off-policy Baselines for Memory-based Continuous Control},
author = {Zhihan Yang and Hai Nguyen},
journal= {arXiv preprint arXiv:2110.12628},
year = {2021}
}