中文

增强大规模模型参数效率与泛化性能:正则化和掩码低秩适应方法

机器学习 2024-07-18 v1 人工智能

摘要

大型预训练模型,如大型语言模型 (LLM),因其庞大的参数规模在微调过程中 presents 显著的资源挑战,尤其是针对移动系统的应用。为此,已开发出低秩适应 (LoRA) 以在保持满意微调结果的同时减少资源消耗。尽管 LoRA 效果显著,但原始方法面临性能次优和过拟合的挑战。本文研究 LoRA 方法近似矩阵更新的内在维度,揭示了增加该内在维度所带来的性能提升。通过采用正则化和一种鼓励更高内在维度的梯度掩码方法,我们提出的方法称为正则化掩码 LoRA (RM-LoRA),在各种开源视觉和语言数据集上,以相同或更少的可训练参数预算,相较于原始 LoRA 及其最新变体实现更好的泛化性能。

关键词

引用

@article{arxiv.2407.12074,
  title  = {Enhancing Parameter Efficiency and Generalization in Large-Scale Models: A Regularized and Masked Low-Rank Adaptation Approach},
  author = {Yuzhu Mao and Siqi Ping and Zihao Zhao and Yang Liu and Wenbo Ding},
  journal= {arXiv preprint arXiv:2407.12074},
  year   = {2024}
}