中文

预训练语言模型的持续领域调优

计算与语言 2021-03-22 v2 机器学习

摘要

诸如 BERT、DistilBERT 和 RoBERTa 之类的预训练语言模型(LM)可以通过在新目标领域语料上继续预训练阶段来针对不同的领域进行调优(领域调优)。这种简单领域调优(SDT)技术已被广泛用于创建领域调优模型,如 BioBERT、SciBERT 和 ClinicalBERT。然而,在目标领域上的预训练阶段,LM 模型可能会灾难性地遗忘从源领域学到的模式。在这项工作中,我们研究了灾难性遗忘对领域调优 LM 模型的影响,并探讨了减轻其负面效应的方法。我们提出了基于持续学习(CL)的 SDT 替代方案,旨在减少灾难性遗忘。我们表明,这些方法可以提升 LM 模型在下游目标领域任务上的性能。此外,我们还表明,约束 LM 模型不遗忘源领域可得到对领域偏移更具鲁棒性的下游任务模型。我们分析了使用所提出的 CL 方法的计算成本,并为计算轻量且有效的 CL 领域调优流程提供了建议。

关键词

引用

@article{arxiv.2004.02288,
  title  = {Continual Domain-Tuning for Pretrained Language Models},
  author = {Subendhu Rongali and Abhyuday Jagannatha and Bhanu Pratap Singh Rawat and Hong Yu},
  journal= {arXiv preprint arXiv:2004.02288},
  year   = {2021}
}

备注

Updated from a previous shorter version