中文

MoS:通过碎片混合技术释放低秩适应的参数效率

机器学习 2025-02-18 v2

摘要

大型语言模型的快速规模化 necessitates 更轻量级的 finetuning 方法以减少大量定制模型同时部署时的 GPU 内存开销。针对更高效的参数低秩适应 (LoRA),参数共享 presents 一个有前景的解决方案。我们通过高层次共享原则的研究,突出了区分在逆转纯粹共享的有害影响方面的不可或缺作用。基于这一发现,我们提出 Mixture of Shards (MoS),包含了跨层和 intra-layer 共享方案,并整合了四种几乎无成本的区分策略,即子集选择、配对解离、向量分片和碎片私有化。简而言之,它从全局池中选择指定数量的碎片,采用类似 Mixture-of-Experts (MoE) 的路由机制,然后依次拼接到低秩矩阵上。因此,它保留了 LoRA 的全部优势,同时提供了更高的参数效率,有效规避了同类参数共享方法的缺点。我们的实验表明,在标准 LoRA 设置下,约可实现 8 倍的参数节省。消融实验确认了每个组件的重要性。我们的洞见可能为更高效的 finetuning 方法的未来发展指明方向。代码已在 https://github.com/Forence1999/MoS 上官方提供。

关键词

引用

@article{arxiv.2410.00938,
  title  = {MoS: Unleashing Parameter Efficiency of Low-Rank Adaptation with Mixture of Shards},
  author = {Sheng Wang and Liheng Chen and Pengan Chen and Jingwei Dong and Boyang Xue and Jiyue Jiang and Lingpeng Kong and Chuan Wu},
  journal= {arXiv preprint arXiv:2410.00938},
  year   = {2025}
}