中文

PANDA:提示迁移结合知识蒸馏的高效模型适配

计算与语言 2024-04-03 v2

摘要

提示迁移(PoT)是近期提出的一种改进提示微调的方法,它通过用相似源任务上训练好的已有提示来初始化目标提示。然而,这种朴素的PoT方法通常取得次优性能,因为(i)PoT对源-目标对的相似性敏感,且(ii)直接在目标任务上微调以源提示初始化的提示可能导致遗忘从源任务中学到的有用通用知识。为解决这些问题,我们提出了一种新度量来准确预测提示可迁移性(针对(i)),以及一种新颖的PoT方法(称为PANDA),其利用知识蒸馏技术有效缓解知识遗忘(针对(ii))。在跨越5种规模PLM的21个源数据集与9个目标数据集共189种组合上的大量系统性实验表明:1)我们提出的度量能很好地预测提示可迁移性;2)我们的PANDA在所有任务和模型规模上平均比朴素PoT方法高出2.3%的分数(最高达24.1%);3)借助我们的PANDA方法,提示微调在各种PLM规模场景下都能取得与模型微调相当甚至更优的性能。我们已在 https://github.com/WHU-ZQH/PANDA 公开发布代码。

关键词

引用

@article{arxiv.2208.10160,
  title  = {PANDA: Prompt Transfer Meets Knowledge Distillation for Efficient Model Adaptation},
  author = {Qihuang Zhong and Liang Ding and Juhua Liu and Bo Du and Dacheng Tao},
  journal= {arXiv preprint arXiv:2208.10160},
  year   = {2024}
}

备注

Accepted by IEEE TKDE