中文

重访少样本 BERT 微调

计算与语言 2021-03-12 v3 机器学习

摘要

本文是对 BERT 上下文表示微调的研究,重点关注少样本场景中常见观察到的不稳定性。我们确定了导致此种不稳定性的若干因素:常用具有偏置梯度估计的非标准优化方法;BERT 网络中很大一部分对下游任务的有限适用性;以及普遍采用的预先确定且较少训练迭代次数的做法。我们经验性地检验了这些因素的影响,并确定了可解决该过程常见不稳定性的替代做法。鉴于这些观察,我们重访近期提出的借助 BERT 改进少样本微调的方法,并重新评估其有效性。总体而言,我们观察到这些方法的影響在我们修改后的流程下显著减弱。

关键词

引用

@article{arxiv.2006.05987,
  title  = {Revisiting Few-sample BERT Fine-tuning},
  author = {Tianyi Zhang and Felix Wu and Arzoo Katiyar and Kilian Q. Weinberger and Yoav Artzi},
  journal= {arXiv preprint arXiv:2006.05987},
  year   = {2021}
}

备注

Code available at https://github.com/asappresearch/revisit-bert-finetuning