中文

信任区域内的任务算术:一种用于导航知识冲突的无训练模型合并方法

机器学习 2025-01-28 v1 人工智能

摘要

多任务模型合并提供了一种高效的解决方案,用于整合来自多个微调模型的知识,缓解了多任务训练所需的计算和存储资源。作为该领域的关键技术,任务算术(Task Arithmetic, TA)通过在参数空间中从预训练模型(θpre\theta_{\text{pre}})中减去微调任务模型,定义任务向量;然后调整这些任务向量与θpre\theta_{\text{pre}}之间的权重,以平衡任务通用知识和任务特定知识。尽管TA取得了令人期待的性能,但当不同任务需要不同的模型适应时,任务向量之间会出现冲突。本文正式将此问题定义为知识冲突, characterized by one task after merging with a model fine-tuned for another task. 通过深入分析,我们展示这些冲突主要来自与θpre\theta_{\text{pre}}处于任务特定损失梯度方向的任务向量组件。为此,我们提出了任务算术在信任区域内(Task Arithmetic in Trust Region, TATR),将信任区域定义为在模型参数空间中仅造成小变化(对应于梯度正交方向的任务向量组件)的维度。将参数合并限制在该信任区域内,TATR能够有效缓解知识冲突。此外,TATR既可作为独立方法,也可作为与多种基于TA的方法兼容的即插即用模块。对八个不同数据集上的大量经验评估稳健地证明,TATR通过可观察的幅度提高了Several TA-based模型合并方法的多任务性能。

关键词

引用

@article{arxiv.2501.15065,
  title  = {Task Arithmetic in Trust Region: A Training-Free Model Merging Approach to Navigate Knowledge Conflicts},
  author = {Wenju Sun and Qingyong Li and Wen Wang and Yangli-ao Geng and Boyang Li},
  journal= {arXiv preprint arXiv:2501.15065},
  year   = {2025}
}

备注

21pages, 6 figures, 6 tables