基于递归最小二乘法的分析子空间路由: 大语言模型持续学习中的工作原理
机器学习
2025-07-09 v2 人工智能
计算与语言
摘要
大型语言模型 (LLM) 拥有处理多样语言任务的广泛能力。然而, 对 LLM 进行微调会削弱这些通用技能, 而持续微调进一步会导致对已积累知识的严重退化。最近, 大语言模型中的持续学习 (CL) arises, 旨在在保持先前学习知识的同时适应新任务并继承通用技能。现有技术要么利用先前数据进行回放, 导致额外计算成本; 要么利用单一参数高效模块学习下游任务, 限制新知识吸收并导致不同任务之间产生干扰。针对上述问题, 本文提出了分析子空间路由 (ASR) 以解决这些挑战。对于每个任务, 我们通过低秩适应在深层特征的子空间内隔离学习, 消除不同任务之间的知识干扰。此外, 我们提出了分析路由机制以正确利用不同子空间中学习的知识。我们的方法采用递归最小二乘法训练多任务路由模型, 允许路由器动态适应新数据而无需访问历史数据。路由器有效地将当前任务分配给合适的子空间, 并通过严格的理论保证具有对先前学习任务的非遗忘性。实验结果表明, 该方法在保持先前知识的同时无缝整合新信息, 有效克服了现有方法的核心局限性。我们的代码将在接受后公开。
引用
@article{arxiv.2503.13575,
title = {Analytic Subspace Routing: How Recursive Least Squares Works in Continual Learning of Large Language Model},
author = {Kai Tong and Kang Pan and Xiao Zhang and Erli Meng and Run He and Yawen Cui and Nuoyan Guo and Huiping Zhuang},
journal= {arXiv preprint arXiv:2503.13575},
year = {2025}
}
备注
11 pages, 4 figures