中文

Decision S4:基于状态空间层的高效序列强化学习方法

机器学习 2023-06-09 v1

摘要

近来,序列学习方法已被应用于离策略强化学习问题,包括开创性的 Decision Transformers 工作,其为此任务采用了 transformers。由于 transformers 参数繁重、无法利用超出固定窗口大小的历史信息,且并非基于递推计算,我们着手研究 S4 系列模型的适用性,该类模型基于状态空间层,已被证明优于 transformers,尤其在建模长程依赖方面。在本文中,我们提出两种主要算法:(i) 一种处理轨迹的离策略训练过程,同时仍保持 S4 模型的训练效率。(ii) 一种以递推方式训练的在策略训练过程,受益于长程依赖,并基于一种新颖的稳定 actor-critic 机制。我们的结果表明,我们的方法在大多数任务上优于 Decision Transformers 的多个变体以及其他基线方法,同时将延迟、参数数量和训练时间减少了数个数量级,使我们的方法更适用于真实世界 RL。

关键词

引用

@article{arxiv.2306.05167,
  title  = {Decision S4: Efficient Sequence-Based RL via State Spaces Layers},
  author = {Shmuel Bar-David and Itamar Zimerman and Eliya Nachmani and Lior Wolf},
  journal= {arXiv preprint arXiv:2306.05167},
  year   = {2023}
}

备注

21 pages,13 figures