Decision S4:基于状态空间层的高效序列强化学习方法
机器学习
2023-06-09 v1
摘要
近来,序列学习方法已被应用于离策略强化学习问题,包括开创性的 Decision Transformers 工作,其为此任务采用了 transformers。由于 transformers 参数繁重、无法利用超出固定窗口大小的历史信息,且并非基于递推计算,我们着手研究 S4 系列模型的适用性,该类模型基于状态空间层,已被证明优于 transformers,尤其在建模长程依赖方面。在本文中,我们提出两种主要算法:(i) 一种处理轨迹的离策略训练过程,同时仍保持 S4 模型的训练效率。(ii) 一种以递推方式训练的在策略训练过程,受益于长程依赖,并基于一种新颖的稳定 actor-critic 机制。我们的结果表明,我们的方法在大多数任务上优于 Decision Transformers 的多个变体以及其他基线方法,同时将延迟、参数数量和训练时间减少了数个数量级,使我们的方法更适用于真实世界 RL。
引用
@article{arxiv.2306.05167,
title = {Decision S4: Efficient Sequence-Based RL via State Spaces Layers},
author = {Shmuel Bar-David and Itamar Zimerman and Eliya Nachmani and Lior Wolf},
journal= {arXiv preprint arXiv:2306.05167},
year = {2023}
}
备注
21 pages,13 figures