中文

Decision Mamba:通过混合选择性序列建模的强化学习

机器学习 2024-06-04 v1

摘要

最近的研究表明,Transformer模型在强化学习(RL)中具有显著优越性,其中决策问题被表述为序列生成。基于Transformer的智能体可以通过提供任务上下文(例如多条轨迹)在在线环境中实现自我改进,这称为上下文强化学习。然而,由于Transformer中注意力的二次计算复杂度,当前的上下文强化学习方法随着任务范围的增加而面临巨大的计算成本。相比之下,Mamba模型以其高效处理长期依赖的能力而闻名,这为上下文强化学习解决需要长期记忆的任务提供了机会。为此,我们首先通过替换Decision Transformer(DT)的主干来实现Decision Mamba(DM)。然后,我们提出了一种Decision Mamba-Hybrid(DM-H),它结合了Transformer在高质量预测和Mamba在长期记忆方面的优点。具体来说,DM-H首先通过Mamba模型从长期记忆中生成高价值子目标。然后,我们使用子目标来提示Transformer,建立高质量预测。实验结果表明,DM-H在长期和短期任务(如D4RL、Grid World和Tmaze基准)上达到了最先进水平。在效率方面,DM-H在长期任务中的在线测试比基于Transformer的基线快28倍。

关键词

引用

@article{arxiv.2406.00079,
  title  = {Decision Mamba: Reinforcement Learning via Hybrid Selective Sequence Modeling},
  author = {Sili Huang and Jifeng Hu and Zhejian Yang and Liwei Yang and Tao Luo and Hechang Chen and Lichao Sun and Bo Yang},
  journal= {arXiv preprint arXiv:2406.00079},
  year   = {2024}
}

备注

arXiv admin note: text overlap with arXiv:2405.20692. arXiv admin note: text overlap with arXiv:2405.20692; text overlap with arXiv:2305.16554, arXiv:2210.14215 by other authors