迈向随时微调:基于超网络提示的持续预训练语言模型
计算与语言
2023-10-23 v1 人工智能
机器学习
摘要
在快速演进的世界中,持续预训练对于将预训练模型适配至众多领域与任务已十分紧迫。实践中,持续预训练模型不仅应在预训练领域微调时展现更强能力,也应在未见领域上保持不降的性能。本文中,我们首先考察现有持续预训练方法的此种随时微调有效性,得出其在未见领域上性能一致下降的结论。为此,我们提出一种提示引导的持续预训练方法,训练超网络通过一致损失与不一致损失生成领域特定提示。一致损失最大程度保留预训练模型对新领域的泛化能力,不一致损失则守护各领域生成隐状态的专业性。值得注意的是,超网络生成的提示在微调时缓解领域身份并促进跨领域知识迁移。我们的方法在两个真实数据集(含领域偏移与时间偏移)上分别取得 3.57% 与 3.4% 的提升,证明其有效性。
引用
@article{arxiv.2310.13024,
title = {Towards Anytime Fine-tuning: Continually Pre-trained Language Models with Hypernetwork Prompt},
author = {Gangwei Jiang and Caigao Jiang and Siqiao Xue and James Y. Zhang and Jun Zhou and Defu Lian and Ying Wei},
journal= {arXiv preprint arXiv:2310.13024},
year = {2023}
}