超越任务向量:基于重要性指标的选择性任务算术
机器学习
2024-11-26 v1
摘要
预训练模型通过利用大规模预学习的知识表示,在广泛的任务上实现了显著的性能提升,从而推动了深度学习的快速发展。然而,在实际的多任务学习(MTL)场景中部署这些模型,面临着高计算成本和推理效率低下的主要挑战。传统方法如剪枝、量化和知识蒸馏已被探索以缓解这些问题,但往往难以完全解决多任务环境的复杂性。本文引入了选择性任务算术(Selecive Task Arithmetic, STA),一个训练自由的框架,通过任务特定的参数融合来提升多任务性能。STA针对三个关键挑战进行了解决:(i) 参数重要性多样性:识别到不同任务依赖于不同的参数,STA采用源于一阶泰勒展开的损失敏感参数重要性指标,准确衡量每个任务的参数重要性。(ii) 过度依赖超参数调优:通过参数重要性指标增强任务向量的稀疏性,STA减少了对大量超参数调优的需求,从而提高了模型的泛化性和鲁棒性。(iii) 忽视任务算术中的其他能力:以往工作在实现更精确的任务遗忘方面 largely 忽视了潜在可能性。STA利用其参数重要性指标实现更可控、更有效的任务遗忘,最小化可能导致模型性能下降的噪声元素。实验结果表明,STA在各类基准测试中实现了卓越的多任务性能,并在任务遗忘方面表现优异。
引用
@article{arxiv.2411.16139,
title = {Beyond Task Vectors: Selective Task Arithmetic Based on Importance Metrics},
author = {Tian Bowen and Lai Songning and Wu Jiemin and Shuai Zhihao and Ge Shiming and Yue Yutao},
journal= {arXiv preprint arXiv:2411.16139},
year = {2024}
}
备注
Under Review