中文

Decision Mamba:基于选择性状态空间序列建模的强化学习

机器学习 2024-04-01 v1 人工智能

摘要

Decision Transformer 是一种将 Transformer 架构应用于强化学习的有前景方法,它依赖因果自注意力来对状态、动作和奖励序列进行建模。尽管该方法已展现出有竞争力的结果,本文探究了将 Mamba 框架(以其在高效且有效的序列建模方面的先进能力而闻名)集成到 Decision Transformer 架构中,重点关注其在序列决策任务中的潜在性能提升。我们的研究通过在多种决策环境中进行一系列实验,系统性地评估了这种集成,将修改后的 Decision Transformer,即 Decision Mamba,与其传统对应模型进行了比较。这项工作为序列决策模型的进步做出了贡献,表明神经网络的架构和训练方法能显著影响其在复杂任务中的性能,并凸显了 Mamba 作为提升强化学习场景中基于 Transformer 模型效能的宝贵工具的潜力。

关键词

引用

@article{arxiv.2403.19925,
  title  = {Decision Mamba: Reinforcement Learning via Sequence Modeling with Selective State Spaces},
  author = {Toshihiro Ota},
  journal= {arXiv preprint arXiv:2403.19925},
  year   = {2024}
}

备注

8 pages, 1 figure