中文

面向预训练语言模型微调的超参数优化实证研究

计算与语言 2021-06-18 v1

摘要

微调预训练语言模型的性能在很大程度上取决于超参数配置。本文中,我们研究了现代超参数优化方法(HPO)在微调预训练语言模型上的表现。首先,我们研究并报告了三种 HPO 算法在 GLUE 数据集上微调两个最先进语言模型的性能。我们发现,在相同时间预算下,HPO 常因两个原因未能优于网格搜索:时间预算不足与过拟合。我们提出了两种通用策略及一套实验流程,以系统性排查 HPO 的失败案例。应用该流程后,我们观察到在更恰当的搜索空间与时间预算设置下 HPO 可以成功;但在某些情况下过拟合仍然存在。最后,我们对未来工作提出建议。我们的实现可在 https://github.com/microsoft/FLAML/tree/main/flaml/nlp/ 找到。

关键词

引用

@article{arxiv.2106.09204,
  title  = {An Empirical Study on Hyperparameter Optimization for Fine-Tuning Pre-trained Language Models},
  author = {Xueqing Liu and Chi Wang},
  journal= {arXiv preprint arXiv:2106.09204},
  year   = {2021}
}

备注

To appear in ACL-IJCNLP 2021