中文

低秩适配降低顺序变换器编码器微调中的灾难性遗忘:受控实证及冻结骨干表示探针

机器学习 2026-03-31 v1

摘要

预训练语言编码器的顺序微调常会覆盖先前获取的能力,但参数高效更新的遗忘行为仍未得到充分刻画。我们进行了一项受控实证研究,探讨低秩适配(LoRA)在顺序变换器编码器微调中的作用,辅以表示探针以检验其稳健性的冻结骨干解释。在五次对BERT-base进行完整验证的RTE->MRPC->CoLA->SST-2序列微调中,完整微调导致平均遗忘率为19.9%±4.8%,而标准LoRA(r=8,查询/值模块)仅为0.6%±1.4%(配对t检验,p=0.002,Cohen's d_s=3.12)。任务层面的分析确认,这一降低并非仅 arising from aggregate效应。二次实验在RoBERTa-base上也显示相同模式,最强的EWC基线仍为15.5%±1.4%的遗忘率。六任务扩展揭示,低平均遗忘可能掩盖了强烈的任务层级异质性。细粒度冻结消融实验显示,一旦冻结参数超过约95%,遗忘率显著下降,分类器-only和浅层适配器基线趋近LoRA。伴随的任务相似性探针在GPT-2和RoBERTa中呈现相同趋势:冻结骨干 regime 保留的任务间相似性高于完整微调,逐步解冻削弱稳定性,而完整微调在最终变换器层显示出最明显的差异。这些结果支持一种受限的机制解释:LoRA之所以有效,主要因骨干冻结保留了更稳定的共享特征框架。我们将标准LoRA定位为顺序编码器适应的强有力实证基线,以及选择性可塑性如何塑造变换器持续学习中干扰的有用探针。

关键词

引用

@article{arxiv.2603.27707,
  title  = {Low-Rank Adaptation Reduces Catastrophic Forgetting in Sequential Transformer Encoder Fine-Tuning: Controlled Empirical Evidence and Frozen-Backbone Representation Probes},
  author = {Ashish Pandey},
  journal= {arXiv preprint arXiv:2603.27707},
  year   = {2026}
}

备注

14 pages, 11 figures, 4 tables. 234 experiments across BERT-base, RoBERTa-base, GPT-2. Submitted to TMLR