中文

层感知任务算术:解耦任务特定知识与指令遵循知识

计算与语言 2025-02-28 v1 机器学习

摘要

大型语言模型 (LLM) 通过微调展现出强大的任务特定能力,但将多个微调模型合并时常会导致性能下降,由于指令遵循组件之间存在重叠。任务算术 (Task Arithmetic, TA) 通过整合来自微调的任务向量,实现多任务学习和任务遗忘,但难以区分任务特定知识与通用指令遵循行为。为此,我们提出了层感知任务算术 (Layer-Aware Task Arithmetic, LATA),一种 novel 方法,通过根据任务向量与指令遵循或任务特定组件的对齐程度,为各层分配特定权重。通过放大任务相关层并削弱指令遵循层,LATA 在保持整体模型效用的同时,提升了任务学习和遗忘性能。实验在多个基准测试上(包括 WikiText-2、GSM8K 和 HumanEval)均表明,LATA 在多任务学习和选择性任务遗忘中超越现有方法,实现更高的任务准确率与对齐度,且输出质量损失最小。我们的发现表明,层级分析在解耦任务特定知识与通用知识方面至关重要,为高效模型合并与编辑提供了稳健框架。

关键词

引用

@article{arxiv.2502.20186,
  title  = {Layer-Aware Task Arithmetic: Disentangling Task-Specific and Instruction-Following Knowledge},
  author = {Yan-Lun Chen and Yi-Ru Wei and Chia-Yi Hsu and Chia-Mu Yu and Chun-Ying Huang and Ying-Dar Lin and Yu-Sung Wu and Wei-Bin Lee},
  journal= {arXiv preprint arXiv:2502.20186},
  year   = {2025}
}