预训练模型间任务向量传输的梯度符号掩码
机器学习
2026-02-23 v3 人工智能
计算机视觉与模式识别
摘要
当基础模型发布新版本时, 从业者通常需要重复微调, 即使同一任务已在先前版本中完成。一个有前景的替代方案是复用参数变化(即任务向量), 这些变化捕获了模型如何适应特定任务。然而, 这些向量通常无法在不同预训练模型之间传输, 因为它们的参数空间未对齐。在本工作中, 我们表明成功传输在很大程度上取决于新模型的梯度符号结构。基于这一洞察, 我们提出了 GradFix, 它近似理想的符号结构并利用它仅通过少量标注样本传输知识。值得注意的是, 这不需要额外的微调:我们仅计算少量目标模型梯度而不更新参数, 并相应地掩码源任务向量。由此产生的更新在局部上与目标损失景观对齐, 有效地将任务向量重新基线到新的预训练上。我们提供了理论保证, 证明我们的方法确保一阶下降。在经验上, 我们在视觉和语言基准上展示了显著的性能提升, 持续优于朴素的任务向量加法和少样本微调。我们进一步证明传输任务向量改善了多任务和多源模型合并。代码可在 https://github.com/fillo-rinaldi/GradFix 获取。
引用
@article{arxiv.2510.09658,
title = {Gradient-Sign Masking for Task Vector Transport Across Pre-Trained Models},
author = {Filippo Rinaldi and Aniello Panariello and Giacomo Salici and Fengyuan Liu and Marco Ciccone and Angelo Porrello and Simone Calderara},
journal= {arXiv preprint arXiv:2510.09658},
year = {2026}
}
备注
Accepted at ICLR 2026