通过自集成与自蒸馏改进BERT微调
计算与语言
2020-02-25 v1 机器学习
摘要
微调诸如BERT之类的预训练语言模型已成为自然语言处理(NLP)中的有效方法,并在许多下游任务上取得了最先进(SOTA)的结果。近期关于将BERT适配到新任务的研究主要关注修改模型结构、重新设计预训练任务以及利用外部数据和知识。微调策略本身尚未得到充分探索。在本文中,我们通过两种有效机制改进BERT的微调:自集成(self-ensemble)与自蒸馏(self-distillation)。在文本分类和自然语言推理任务上的实验表明,我们提出的方法无需任何外部数据或知识即可显著改善BERT的适配性。
引用
@article{arxiv.2002.10345,
title = {Improving BERT Fine-Tuning via Self-Ensemble and Self-Distillation},
author = {Yige Xu and Xipeng Qiu and Ligao Zhou and Xuanjing Huang},
journal= {arXiv preprint arXiv:2002.10345},
year = {2020}
}
备注
7 pages, 6 figures