结构化非限制秩矩阵用于参数高效微调
机器学习
2024-12-19 v3 人工智能
计算机视觉与模式识别
摘要
近期大量研究表明,扩大 Transformer 模型规模在广泛的任务范围内取得了快速进展(Wei 等,2022)。然而,对这些大规模参数模型进行下游任务微调成本高昂。参数高效微调(PEFT)方法因只更新少量参数而成为可行的替代方案。本文我们提出了一种通用的 PEFT 框架,基于结构化非限制秩矩阵(SURM),可作为流行方法(如 Adapters 和 LoRA)的即插即用替换方案。与其他方法(如 LoRA)不同,SURM 在紧凑性和表达性之间提供了更大的灵活性。这一优势通过使用低位移秩矩阵(LDRMs)实现,此类矩阵此前未在此类上下文中使用。SURM 虽保持与基线方法的竞争力,常常在更小的参数预算下实现显著的质量提升。在各种图像分类任务上,SURM 可实现 5-7% 的准确率提升,取代 LoRA 中的低秩矩阵;在 GLUE 数据集上,SURM 还可实现对参数数量最高可达 12 倍的压缩,同时几乎不损失质量。
引用
@article{arxiv.2406.17740,
title = {Structured Unrestricted-Rank Matrices for Parameter Efficient Fine-tuning},
author = {Arijit Sehanobish and Avinava Dubey and Krzysztof Choromanski and Somnath Basu Roy Chowdhury and Deepali Jain and Vikas Sindhwani and Snigdha Chaturvedi},
journal= {arXiv preprint arXiv:2406.17740},
year = {2024}
}
备注
Accepted at NeurIPS 2024