中文

利用Mamba扩展连续控制的算法蒸馏

机器学习 2025-06-18 v1 人工智能 机器人学

摘要

算法蒸馏(AD)最近被提出作为一种通过自回归建模跨片段训练历史来执行上下文强化学习(ICRL)的新方法。然而,由于注意力机制带来的实际限制,实验受限于Transformer的二次复杂度,仅限于具有短时间范围的简单离散环境。在这项工作中,我们提出利用最近提出的选择性结构化状态空间序列(S6)模型,该模型在长程序列建模方面取得了最先进(SOTA)性能,且随序列长度线性扩展。通过四个复杂且连续的元强化学习环境,我们证明了由S6层构建的Mamba模型在AD方面相对于Transformer模型的整体优越性。此外,我们展示了将AD扩展到极长上下文可以改善ICRL性能,使其即使与最先进的在线元RL基线相比也具有竞争力。

关键词

引用

@article{arxiv.2506.13892,
  title  = {Scaling Algorithm Distillation for Continuous Control with Mamba},
  author = {Samuel Beaussant and Mehdi Mounsif},
  journal= {arXiv preprint arXiv:2506.13892},
  year   = {2025}
}