状态空间模型的参数高效微调
机器学习
2025-06-10 v3 计算与语言
摘要
深度状态空间模型(SSMs),如Mamba(Gu & Dao, 2024),已成为语言建模的强大工具,具备高性能和随序列长度线性可扩展性。然而,参数高效微调(PEFT)方法在SSM模型上的应用仍显得有限。我们首先探讨两个根本问题:(i)现有PEFT方法在SSM模型上表现如何?(ii)应聚焦哪些参数才能获得最佳效果?我们的分析表明,LoRA及其变体在SSM模型上表现始终优于所有其他PEFT方法。虽然LoRA对线性投影矩阵有效,但在SSM模块上效果不佳——尽管其他适用于SSM的方法在LoRA之下仍有优势,这凸显了其局限性。这进一步凸显了针对SSM模块的专业化调优方法的必要性。为此,我们提出稀疏维度调优(Sparse Dimension Tuning, SDT),一种专为SSM模块设计的PEFT方法。将SDT用于SSM模块,再结合LoRA用于线性投影矩阵,我们在广泛实验中实现了最先进的性能。
引用
@article{arxiv.2410.09016,
title = {Parameter-Efficient Fine-Tuning of State Space Models},
author = {Kevin Galim and Wonjun Kang and Yuchen Zeng and Hyung Il Koo and Kangwook Lee},
journal= {arXiv preprint arXiv:2410.09016},
year = {2025}
}
备注
Accepted at ICML 2025. Code is available at https://github.com/furiosa-ai/ssm-peft