使用少 10 倍参数的 MoRe 微调
机器学习
2025-04-08 v2 人工智能
摘要
参数高效微调(PEFT)技术释放了低成本、便捷地定制大型预训练模型的潜力。然而,最突出的方法(如低秩适配器 LoRA)在架构选择上依赖于启发式方法或经验法则——这可能限制了它们在新模型和架构上的性能。这一局限性表明,神经架构搜索技术可用于获取最优的适配器架构,但这些技术通常成本高昂且难以实现。我们通过 Monarch 矩形微调(MoRe)来应对这一挑战,这是一个基于 Monarch 矩阵类来搜索适配器架构的简单框架。在理论上,我们证明了 MoRe 比 LoRA 具有更强的表达能力。在实验上,我们的方法在一系列任务和模型上比 SOTA PEFT 方法具有更高的参数效率和更好的性能,而仅需 LoRA 5% 的参数。
引用
@article{arxiv.2408.17383,
title = {MoRe Fine-Tuning with 10x Fewer Parameters},
author = {Wenxuan Tan and Nicholas Roberts and Tzu-Heng Huang and Jitian Zhao and John Cooper and Samuel Guo and Chengyu Duan and Frederic Sala},
journal= {arXiv preprint arXiv:2408.17383},
year = {2025}
}