CorDA:面向上下文的分解适应方法用于大语言模型的任务感知参数高效微调
机器学习
2025-03-11 v3 人工智能
摘要
当前的参数高效微调(PEFT)方法构建的适配器通常与下游任务的学习上下文或需要维护的重要知识上下文无关。因此,与全参数微调相比,通常存在性能差距,同时微调后的模型会遭受预训练世界知识的灾难性遗忘。在本文中,我们提出了CorDA,一种面向上下文的分解适应方法,该方法通过以下方式构建可学习的任务感知适配器:根据下游任务的上下文或要维护的世界知识来定向权重分解。具体来说,我们收集少量数据样本,并对预训练LLM的每个线性层乘以使用这些样本的输入激活的协方差矩阵进行奇异值分解。协方差矩阵的逆矩阵与分解后的分量相乘以重建原始权重。通过这样做,代表性样本的上下文通过决定分解方向而被捕获。我们的方法提供了两种选项:知识保留适应和指令预览适应。对于前者,我们使用问答样本来获得协方差矩阵,并使用具有最小r个奇异值的分解分量来初始化可学习适配器,其他分量被冻结,从而更好地保留世界知识。对于后者,我们使用来自微调任务的指令数据(例如数学或编码)来定向分解,并训练与任务最对应的最大r个分量。我们在数学、编码和指令遵循任务上进行了大量实验。
引用
@article{arxiv.2406.05223,
title = {CorDA: Context-Oriented Decomposition Adaptation of Large Language Models for Task-Aware Parameter-Efficient Fine-tuning},
author = {Yibo Yang and Xiaojie Li and Zhongzhu Zhou and Shuaiwen Leon Song and Jianlong Wu and Liqiang Nie and Bernard Ghanem},
journal= {arXiv preprint arXiv:2406.05223},
year = {2025}
}
备注
NeurIPS 2024