将 Mamba 学习为持续学习者:基于元学习的选择性状态空间模型用于高效持续学习
机器学习
2025-05-27 v4
摘要
持续学习(CL)旨在高效地从非平稳数据流中学习,而无需存储或重新计算所有已见样本。CL 通过融合顺序训练样本来实现对新任务的预测。基于 CL 与顺序建模之间的联系,元持续学习(MCL)旨在元学习一个作为序列预测模型的高效持续学习者,像 Transformer 这样的先进序列模型是自然的选择。然而,尽管性能尚可接受,Transformer 依赖线性增长的缓存来存储所有过去的表示,这与 CL 不存储所有已见样本的目标相冲突,限制了其效率。在本文中,我们聚焦于不保留所有过去表示的序列预测基于持续学习的学习者。虽然基于固定大小隐藏状态(如线性 Transformer)的无注意力模型与 CL 的基本目标和效率需求相吻合,但在先前文献中显示其在 MCL 中效果有限。鉴于 Mamba 在序列建模方面的强大性能及其无注意力特性,我们探讨了一个关键问题:无注意力模型(如 Mamba)在 MCL 上能否表现良好?我们提出了 MambaCL,一个经过元学习的持续学习者。为增强 MambaCL 的训练,我们引入选择性正则化,利用 Mamba 与 Transformer 之间的联系来指导其在序列上的行为。此外,我们通过大量精心设计的实验研究了 Mamba 和其他模型在各种 MCL 场景中的表现。我们的结果突出了 Mamba 和无注意力模型在 MCL 中具有有前景的性能和强大的泛化能力,展示了其在高效持续学习和适应方面的潜力。
引用
@article{arxiv.2412.00776,
title = {Learning Mamba as a Continual Learner: Meta-learning Selective State Space Models for Efficient Continual Learning},
author = {Chongyang Zhao and Dong Gong},
journal= {arXiv preprint arXiv:2412.00776},
year = {2025}
}