中文

通过模块化参数定位实现能力迁移与恢复

计算与语言 2026-01-15 v1 人工智能 机器学习

摘要

大型语言模型可以通过持续预训练或微调来提升在特定领域、语言或技能上的表现,但这种专业化往往会降低其他能力并可能导致灾难性遗忘。我们通过分析在领域和语言特定输入下密切相关的模型的模块激活,研究了能力在 LLM 参数中是如何分布的。跨层和模块,我们发现与能力相关的激活高度集中在一小部分通道中(通常 <5%),并且这些通道在很大程度上是解耦的,具有良好的充分性和稳定性。基于这些观察,我们提出了 ACT(Activation-Guided Channel-wise Ability Transfer,激活引导的通道级能力迁移),它通过激活差异定位与能力相关的通道,并仅选择性迁移相应的参数,随后进行轻量级微调以实现兼容性。在多语言数学和科学推理上的实验表明,ACT 能够恢复被遗忘的能力,同时保留已掌握的技能。它还可以合并多个专用模型,将多种能力集成到单个模型中,且干扰最小。我们的代码和数据将公开发布。

关键词

引用

@article{arxiv.2601.09398,
  title  = {Ability Transfer and Recovery via Modularized Parameters Localization},
  author = {Songyao Jin and Kun Zhou and Wenqi Li and Peng Wang and Biwei Huang},
  journal= {arXiv preprint arXiv:2601.09398},
  year   = {2026}
}