GIST:通过知识交互改进参数高效微调
计算与语言
2023-12-13 v1 计算机视觉与模式识别
摘要
参数高效微调(PEFT)方法通过调整或引入较少的可训练参数来在下游任务上校准预训练模型,已成为近期的研究热点。然而,传统微调框架内的现有 PEFT 方法存在两个主要缺点:1)它们忽略了可训练参数与下游任务知识之间的显式关联。2)它们忽视了预训练模型的内在任务无关知识与下游任务中的任务特定知识之间的交互。为了弥补这一差距,我们以一种即插即用的方式提出了一种名为 GIST 的新型微调框架。具体而言,我们的框架在下游任务上应用 PEFT 方法时,首先引入了一个称为 Gist token 的可训练 token。该 token 作为 PEFT 方法学习到的任务特定知识的聚合器,并与下游知识形成显式关联。此外,为了促进任务无关知识与任务特定知识之间的显式交互,我们通过双向 Kullback-Leibler 散度目标引入了知识交互的概念。因此,我们框架内的 PEFT 方法可以利用知识交互使预训练模型更全面地理解下游任务。大量实验证明了我们框架的普适性与可扩展性。值得注意的是,在 VTAB-1K 基准上,我们在 GIST 框架内采用 Adapter(一种流行的 PEFT 方法)并实现了 2.25% 的性能提升,而参数量仅增加 0.8K。代码将开源。
引用
@article{arxiv.2312.07255,
title = {GIST: Improving Parameter Efficient Fine Tuning via Knowledge Interaction},
author = {Jiacheng Ruan and Jingsheng Gao and Mingye Xie and Suncheng Xiang and Zefang Yu and Ting Liu and Yuzhuo Fu},
journal= {arXiv preprint arXiv:2312.07255},
year = {2023}
}
备注
17pages, 8 figures, 22 tables, Work in progress