任务向量何时在模型编辑中有效?——针对非线性Transformer的泛化分析
机器学习
2025-05-27 v3
摘要
任务算术指的是通过添加加权求和的任务向量来编辑预训练模型,其中每个任务向量都是从预训练模型到针对特定任务微调的模型权重的更新。该方法最近因其作为模型编辑的计算高效推断方法而受到关注,例如多任务学习、遗忘以及超出域泛化能力。然而,由于Transformer-based模型训练的高度非凸性,尚缺乏对为什么任务向量能够执行各种概念操作的理论理解。本文在知情有限的情况下,提供了对非线性Transformer上任务向量方法泛化保证的首个理论表征。我们考虑一种概念学习设定,其中每个任务是基于判别模式的二分类问题。我们理论证明了任务相加在同时学习一组无关或一致任务方面的有效性,以及任务否定在从无关或相互矛盾的任务中遗忘一个任务方面的成功。此外,我们证明了为实现对超出域任务的保证性泛化,正确选择线性系数至关重要。我们的所有理论结果均适用于稠密权重参数及其低秩近似。虽然我们在概念设定下建立了理论,但我们的理论发现在使用13亿参数的大型语言模型Phi-1.5进行实际机器遗忘任务时得到了验证。
引用
@article{arxiv.2504.10957,
title = {When is Task Vector Provably Effective for Model Editing? A Generalization Analysis of Nonlinear Transformers},
author = {Hongkang Li and Yihua Zhang and Shuai Zhang and Meng Wang and Sijia Liu and Pin-Yu Chen},
journal= {arXiv preprint arXiv:2504.10957},
year = {2025}
}
备注
Published at ICLR 2025 as an oral paper