MambaPEFT: 探索 Mamba 的参数高效微调方法
计算与语言
2025-04-02 v3 人工智能
计算机视觉与模式识别
机器学习
摘要
通过利用大规模数据和构建大型模型,已经建立了一个基于 Transformer 的模型生态系统。参数高效微调(PEFT)是一项关键技术,能够以最小成本将这些模型部署到下游任务中,同时实现有效的性能。近期,一种基于状态空间模型(SSM)的 Mamba 模型作为 Transformer 的潜在替代方案引起了广泛关注。虽然已经提出了许多大规模的 Mamba 模型,但如何高效地将预训练的 Mamba 模型适配到下游任务仍然未被探索。在本文中,我们对 Mamba 的 PEFT 方法进行了探索性分析。我们研究了现有 Transformer 的 PEFT 方法应用于 Mamba 时的有效性。我们还修改了这些方法以更好地契合 Mamba 架构。此外,我们提出了利用 Mamba 独特结构的新 Mamba 专用 PEFT 方法。我们的实验表明,PEFT 对 Mamba 的效果优于 Transformer。最后,我们展示了如何有效组合多种 PEFT 方法,并提供了一个超越先前工作的框架。为确保可复现性,我们将在发表后发布代码。
引用
@article{arxiv.2411.03855,
title = {MambaPEFT: Exploring Parameter-Efficient Fine-Tuning for Mamba},
author = {Masakazu Yoshimura and Teruaki Hayashi and Yota Maeda},
journal= {arXiv preprint arXiv:2411.03855},
year = {2025}
}
备注
Accepted to ICLR2025