RoseLoRA:面向知识编辑与微调的预训练语言模型的稀疏低秩适配
计算与语言
2024-10-17 v3
摘要
预训练语言模型在大规模语料上训练,显示出强大的在各种NLP任务上的通用性。为特定任务微调这些模型通常需要更新所有参数,这在资源上较为昂贵。参数高效微调(PEFT)方法,如流行的LoRA系列方法,引入低秩矩阵,仅高效地学习少量参数。然而,在推理期间,这些矩阵的乘积会更新所有预训练参数,这给需要选择性更新的知识编辑任务带来了困难。我们提出了一种新颖的PEFT方法,即行和列稀疏低秩适配(RoseLoRA),以解决这一挑战。RoseLoRA识别并更新特定任务最重要的几个参数,保持效率的同时保留其他模型知识。通过在低秩矩阵乘积上引入稀疏约束并转换为行和列稀疏,我们确保了高效且精确的模型更新。我们的理论分析保证了稀疏性相对于矩阵乘积的下界。针对五个基准测试中的二十个数据集进行的大量实验表明,RoseLoRA在一般微调和知识编辑任务中均优于基线方法。
引用
@article{arxiv.2406.10777,
title = {RoseLoRA: Row and Column-wise Sparse Low-rank Adaptation of Pre-trained Language Model for Knowledge Editing and Fine-tuning},
author = {Haoyu Wang and Tianci Liu and Ruirui Li and Monica Cheng and Tuo Zhao and Jing Gao},
journal= {arXiv preprint arXiv:2406.10777},
year = {2024}
}
备注
EMNLP 2024 main