中文

线性注意力模型中的无忘记微调:面向内在学习的理论分析

计算与语言 2026-02-27 v1 机器学习 机器学习

摘要

基于Transformer的大型语言模型表现出内在学习能力,使其能够通过少量示例的提示进行下游任务适应。在实践中,这些模型通常会被微调以提高下游任务的零样本性能,从而允许它们在没有示例的情况下解决任务,从而降低推理成本。然而,微调可能会损害内在学习,限制了在微调期间未见任务上的性能。我们使用线性注意力模型,提供了一种理论分析,刻画了微调目标如何修改注意力参数,并识别导致稀疏性能下降的条件。我们表明,所有注意力参数的微调会损害内在学习,而仅限制更新值矩阵可提高零样本性能并保留内在学习。我们进一步表明,纳入辅助的少样本损失主要在目标任务上增强内在学习,但以在微调期间未见任务上的内在学习能力受损为代价。我们经验上验证了我们的理论结果。

关键词

引用

@article{arxiv.2602.23197,
  title  = {Fine-Tuning Without Forgetting In-Context Learning: A Theoretical Analysis of Linear Attention Models},
  author = {Chungpa Lee and Jy-yong Sohn and Kangwook Lee},
  journal= {arXiv preprint arXiv:2602.23197},
  year   = {2026}
}