仅微调注意力模块:通过任务算术增强权重 disentanglement
机器学习
2025-01-30 v2
摘要
近年来,任务算术受到日益关注。该方法通过将各种任务的微调权重组合到统一模型中来直接编辑预训练模型的权重空间。其效率和成本效益源于其无需训练的组合,与需要在大数据集上进行多任务模型训练的传统方法形成鲜明对比。然而,将这种统一模型应用于单个任务时,可能会导致来自其他任务的干扰(权重 disentanglement不足)。为解决此问题,已采用神经切向核(NTK)线性化方法,利用 kernel behavior 实现权重 disentanglement 并缓解不相关任务的负面影响。尽管具有优势,NTK 线性化存在缺点,包括翻倍的训练成本以及各个模型性能的降低。为解决此问题,我们提出一种简单而有效且高效的方法,即仅在 Transformer 中微调注意力模块。我们的研究表明,注意力模块表现出 kernel behavior,仅微调注意力模块显著改善了权重 disentanglement。为进一步了解我们方法如何提高任务算术的权重 disentanglement,我们present了一项关于任务算术的全面研究,通过区分 representation module 和 task-specific module 的角色。具体而言,我们发现 representation module 在改善权重 disentanglement 中发挥重要作用,而 task-specific 模块如分类头可能导致权重 disentanglement性能退化。(代码已公开 https://github.com/kyrie-23/task_arithmetic_tangent)
引用
@article{arxiv.2407.07089,
title = {Fine-Tuning Attention Modules Only: Enhancing Weight Disentanglement in Task Arithmetic},
author = {Ruochen Jin and Bojian Hou and Jiancong Xiao and Weijie Su and Li Shen},
journal= {arXiv preprint arXiv:2407.07089},
year = {2025}
}
备注
International Conference on Learning Representations (ICLR 2025)