中文

MoKA:Kronecker 适配器混合

机器学习 2025-08-06 v1 人工智能 计算与语言

摘要

参数高效微调(PEFT)对于降低大语言模型(LLMs)的计算开销至关重要。低秩系列适配器通常用于在保持 LLMs 生成能力的同时有效控制参数规模。然而,由于秩约束导致的表达能力有限,往往限制了它们在复杂任务上的性能。我们提出了 Kronecker 适配器混合,一种新一代 Kronecker 适配器,通过将权重更新建模为 Kronecker 乘积的混合来解决这一局限性。我们提出的适配器利用门控机制来衡量每个 Kronecker 因子的重要性,从而实现更具表达能力的适应。此外,MoKA 实现了秩灵活性,在参数效率和准确性之间提供了更好的权衡。为确保硬件效率,我们使用标准矩阵运算重新表述了 Kronecker 计算,允许在 GPU 优化硬件上无缝部署。我们在指令微调和常识推理任务上,使用 LLaMA2-7B 和 LLaMA3-8B 模型的低比特量化版本进行了广泛实验。MoKA 不仅优于 PEFT 基线,而且将可训练参数的数量减少了高达 27 倍,实现了性能与参数效率之间最先进的权衡。

关键词

引用

@article{arxiv.2508.03527,
  title  = {MoKA: Mixture of Kronecker Adapters},
  author = {Mohammadreza Sadeghi and Mahsa Ghazvini Nejad and MirHamed Jafarzadeh Asl and Yu Gu and Yuanhao Yu and Masoud Asgharian and Vahid Partovi Nia},
  journal= {arXiv preprint arXiv:2508.03527},
  year   = {2025}
}