关于任务向量与梯度
机器学习
2025-10-21 v6 人工智能
摘要
任务算术已作为一种简单而强大的模型合并技术,使能够将多个微调模型合并为一个。尽管其实证成功显著,但缺乏清晰的理论解释阐明其工作原理与适用条件。本文通过建立任务向量与任务损失梯度之间的联系,为任务算术提供严格的理论基础。我们表明,在标准梯度下降下,来自一个微调周期生成的任务向量恰等于损失负梯度按学习率比例缩放后的结果。对于实际的多周期设置,我们证明了这种等价性在近似意义上成立,并显式给出了针对前馈网络的二阶误差项界限。我们的实证分析基于七个视觉基准测试,证实了理论结果,表明单 epoch梯度在范数和方向上主导了整个微调轨迹。一个关键含义是,仅微调单个 epoch的模型合并往往能获得与完全收敛模型合并相当的性能。这些发现将任务算术重新框构为一种近似多任务学习形式,为其有效性提供了清晰的依据,突显了早期训练动力学在模型合并中的关键作用。
引用
@article{arxiv.2508.16082,
title = {On Task Vectors and Gradients},
author = {Luca Zhou and Daniele Solombrino and Donato Crisostomi and Maria Sofia Bucarelli and Giuseppe Alessio D'Inverno and Fabrizio Silvestri and Emanuele Rodolà},
journal= {arXiv preprint arXiv:2508.16082},
year = {2025}
}
备注
10 pages of main paper, 5 figures