面向预训练语言模型微调的超参数优化实证研究
计算与语言
2021-06-18 v1
摘要
微调预训练语言模型的性能在很大程度上取决于超参数配置。本文中,我们研究了现代超参数优化方法(HPO)在微调预训练语言模型上的表现。首先,我们研究并报告了三种 HPO 算法在 GLUE 数据集上微调两个最先进语言模型的性能。我们发现,在相同时间预算下,HPO 常因两个原因未能优于网格搜索:时间预算不足与过拟合。我们提出了两种通用策略及一套实验流程,以系统性排查 HPO 的失败案例。应用该流程后,我们观察到在更恰当的搜索空间与时间预算设置下 HPO 可以成功;但在某些情况下过拟合仍然存在。最后,我们对未来工作提出建议。我们的实现可在 https://github.com/microsoft/FLAML/tree/main/flaml/nlp/ 找到。
引用
@article{arxiv.2106.09204,
title = {An Empirical Study on Hyperparameter Optimization for Fine-Tuning Pre-trained Language Models},
author = {Xueqing Liu and Chi Wang},
journal= {arXiv preprint arXiv:2106.09204},
year = {2021}
}
备注
To appear in ACL-IJCNLP 2021