用任务算术编辑模型
机器学习
2023-04-03 v3 计算与语言
计算机视觉与模式识别
摘要
改变预训练模型的行为——例如提升其在下游任务上的性能或缓解预训练期间学到的偏见——是开发机器学习系统时的常见做法。在这项工作中,我们提出一种以\textit{任务向量}为核心的引导神经网络行为的新范式。任务向量指定了预训练模型权重空间中的一个方向,沿该方向移动可提升任务性能。我们通过从某任务微调后模型的权重中减去预训练模型的权重来构建任务向量。我们表明这些任务向量可通过取负、相加等算术运算进行修改与组合,相应模型的行为也随之被引导。对任务向量取负会降低目标任务上的性能,而对控制任务上的模型行为影响甚微。此外,将任务向量相加可一次性提升多个任务的性能。最后,当任务间存在“A之于B如同C之于D”的类比关系时,组合其中三个任务的向量可提升第四个任务的性能,即便训练时未使用第四个任务的任何数据。总体而言,我们在多个模型、模态和任务上的实验表明,任务算术是一种简单、高效且有效的模型编辑方法。
引用
@article{arxiv.2212.04089,
title = {Editing Models with Task Arithmetic},
author = {Gabriel Ilharco and Marco Tulio Ribeiro and Mitchell Wortsman and Suchin Gururangan and Ludwig Schmidt and Hannaneh Hajishirzi and Ali Farhadi},
journal= {arXiv preprint arXiv:2212.04089},
year = {2023}
}
备注
In Proceedings of the 11th International Conference on Learning Representations (ICLR 2023)